1. LLMエージェント評価で検索力と統合力を分離

    [AI]

    AgentHopは、最終正答率が近いLLMエージェントでも、根拠文献の取得と取得情報を使った推論の性能が異なり得ることを、計算機科学の問題群で検証した。