The Bitter Lesson of Tool Calling(AI研究)検索・リサーチ確認済み

arXiv論文:AIの道具操作はJSONよりコードが有利な場合——14モデル中11、長い連鎖で差18.8ポイント

BFCL v4でコード型とJSON型のツール呼び出しを比較。新しいモデルほどコード型が強い一方、旧モデルには構文エラーもあった。

  • 2026-08-08
  • 最終確認日 2026-08-08
自分にどう関係する?

複数ツールの連鎖や大量並列ではコード型が有力ですが、安全な隔離実行とモデル別の構文テストが欠かせません。

ニュースをやさしく解説

結論から言うと、AIが複数の道具を使う方法は、決まったJSONを1回ずつ返す方式より、短いプログラムを書いてまとめて実行する方式が有利な場合が多いとする研究が出た。

2026年8月6日にarXivのcs.CLへ投稿された未査読論文「The Bitter Lesson of Tool Calling」は、ClaudeとGPT系の14モデルを、ツール操作評価BFCL v4の309課題で比較した。プログラム型では、型付きPython関数として示された道具をAIがコードから呼び、連鎖や並列処理を1回の実行にまとめる。

主評価では14モデル中11モデルがJSON型と同等以上で、GPT-5.6 SolとTerraはそれぞれ10.6ポイント改善した。12回以上つなぐ課題では差が18.8ポイントに広がり、Claude Sonnet 5の並列試験ではJSON型が70〜72個を超えると呼び出しを落とした一方、プログラム型は100個をすべて列挙した。

長い文脈を追加した試験でも、JSON型は平均2.3%低下したがプログラム型は安定した。開発者には、複雑なAIエージェントでコード実行型を検討する根拠になる。ただしGPT-4oなど一部の旧モデルは、改行記号を誤って構文エラーを起こし成績が悪化した。各追加試験は31〜52件と小さく、論文も査読前なので、権限を絞った隔離環境と自分の課題での再評価が必要だ。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.CL、未査読プレプリント)を開く