arXiv論文:AIエージェントはAPIをまたぐと急失速——VAKRA、深い推論で性能50%以上低下
8000超の実行可能なAPIと62分野を使い、検索・複数API・利用規則を同時に扱うAIエージェントを測るVAKRAを公開した。
AIに社内APIをつなぐだけでは不十分で、複数情報の判断と利用規則の確認が安全運用の要点だと分かります。
ニュースをやさしく解説
結論から言うと、仕事用AIエージェントはAPIを呼ぶ操作そのものより、複数の情報源をつないで考える場面で大きく失敗することが示された。2026年8月12日にarXivで公開された査読前論文で、IBMの研究者らは評価基盤VAKRAを提案した。
VAKRAには62分野、8000を超える実行可能なAPIがあり、呼び出し方が異なるAPIの操作、複数段階の推論、文書検索とAPIをまたぐ推論、さらに「この情報は使ってよい」といった自然言語の利用規則を含む課題を用意する。AIが出した呼び出しは実際のAPIで再実行し、正解へ至る経路が複数あっても判定できる。
エージェント側の作りの差を抑えるため、全モデルを同じReAct方式で評価した。最良モデルでも単一段階のエンドポイント型課題は70.4%で、複数APIを組み合わせる課題では50〜51%へ低下した。考える段階が深くなると性能は50%以上落ち、答えられない質問を規則に従って拒む課題では2.4%まで下がる場合があった。
失敗はAPIの書式より、名前の曖昧さを解くことや複数資料を根拠づける場面に集中したという。社内検索や業務自動化を導入する人には、接続できたことと正しく判断できることは別だと分かる。ただしモデル名別の詳細や実務での影響は本文確認が必要で、評価環境の成績が全企業システムへそのまま当てはまるわけではない。重要操作には権限制限、実行前確認、記録の監査が欠かせない。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。