AI研究検索・リサーチ確認済み

arXiv論文:AIエージェントはAPIをまたぐと急失速——VAKRA、深い推論で性能50%以上低下

8000超の実行可能なAPIと62分野を使い、検索・複数API・利用規則を同時に扱うAIエージェントを測るVAKRAを公開した。

  • 2026-08-14
  • 最終確認日 2026-08-14
自分にどう関係する?

AIに社内APIをつなぐだけでは不十分で、複数情報の判断と利用規則の確認が安全運用の要点だと分かります。

ニュースをやさしく解説

結論から言うと、仕事用AIエージェントはAPIを呼ぶ操作そのものより、複数の情報源をつないで考える場面で大きく失敗することが示された。2026年8月12日にarXivで公開された査読前論文で、IBMの研究者らは評価基盤VAKRAを提案した。

VAKRAには62分野、8000を超える実行可能なAPIがあり、呼び出し方が異なるAPIの操作、複数段階の推論、文書検索とAPIをまたぐ推論、さらに「この情報は使ってよい」といった自然言語の利用規則を含む課題を用意する。AIが出した呼び出しは実際のAPIで再実行し、正解へ至る経路が複数あっても判定できる。

エージェント側の作りの差を抑えるため、全モデルを同じReAct方式で評価した。最良モデルでも単一段階のエンドポイント型課題は70.4%で、複数APIを組み合わせる課題では50〜51%へ低下した。考える段階が深くなると性能は50%以上落ち、答えられない質問を規則に従って拒む課題では2.4%まで下がる場合があった。

失敗はAPIの書式より、名前の曖昧さを解くことや複数資料を根拠づける場面に集中したという。社内検索や業務自動化を導入する人には、接続できたことと正しく判断できることは別だと分かる。ただしモデル名別の詳細や実務での影響は本文確認が必要で、評価環境の成績が全企業システムへそのまま当てはまるわけではない。重要操作には権限制限、実行前確認、記録の監査が欠かせない。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(査読前論文)を開く