arXiv論文:AIの道具操作はJSONよりコードが有利な場合——14モデル中11、長い連鎖で差18.8ポイント
BFCL v4でコード型とJSON型のツール呼び出しを比較。新しいモデルほどコード型が強い一方、旧モデルには構文エラーもあった。
複数ツールの連鎖や大量並列ではコード型が有力ですが、安全な隔離実行とモデル別の構文テストが欠かせません。
ニュースをやさしく解説
結論から言うと、AIが複数の道具を使う方法は、決まったJSONを1回ずつ返す方式より、短いプログラムを書いてまとめて実行する方式が有利な場合が多いとする研究が出た。
2026年8月6日にarXivのcs.CLへ投稿された未査読論文「The Bitter Lesson of Tool Calling」は、ClaudeとGPT系の14モデルを、ツール操作評価BFCL v4の309課題で比較した。プログラム型では、型付きPython関数として示された道具をAIがコードから呼び、連鎖や並列処理を1回の実行にまとめる。
主評価では14モデル中11モデルがJSON型と同等以上で、GPT-5.6 SolとTerraはそれぞれ10.6ポイント改善した。12回以上つなぐ課題では差が18.8ポイントに広がり、Claude Sonnet 5の並列試験ではJSON型が70〜72個を超えると呼び出しを落とした一方、プログラム型は100個をすべて列挙した。
長い文脈を追加した試験でも、JSON型は平均2.3%低下したがプログラム型は安定した。開発者には、複雑なAIエージェントでコード実行型を検討する根拠になる。ただしGPT-4oなど一部の旧モデルは、改行記号を誤って構文エラーを起こし成績が悪化した。各追加試験は31〜52件と小さく、論文も査読前なので、権限を絞った隔離環境と自分の課題での再評価が必要だ。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon本評価順で探す ↗Amazon|LLM・生成AIの仕組みを学ぶ本を評価順で探す個別AIの違いを、LLMの基本から理解したい人向けLLM、生成AI、深層学習の入門書を評価順で探せます。数式多めか実務寄りかを確認して選んでください。
- Amazon評価順で探す ↗Amazon|NotebookLM・Perplexityなど調査AIの本を評価順で探す資料調査・要約・比較をAIで速くしたい人向けNotebookLM、Perplexity、AIリサーチ、情報整理に近い本をレビュー評価順で確認できます。仕事・学習の目的に合わせて確認してください。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。