研究論文検索・リサーチ確認済み

arXiv論文:AIは自分の作業環境をどこまで改善できるか——5モデル・4課題・111回で評価

プロンプトや道具、記憶、制御手順をAI自身に直させる能力を測るHarnessOpt-Benchを提案。

  • 2026-08-08
  • 最終確認日 2026-08-08
自分にどう関係する?

AIの性能はモデル名だけでなく周囲の設定でも変わります。比較時は同じ予算と見えないテストで確かめる視点が重要です。

ニュースをやさしく解説

結論から言うと、AIモデル本体ではなく、周りのプロンプト・道具・記憶・制御手順をAI自身が改善する力を比べる共通評価「HarnessOpt-Bench」が提案された。2026年8月6日にarXivへ投稿された未査読プレプリントで、ここでいうハーネスは、エージェントを実際に働かせるための設定やプログラム一式を指す。

評価では、最適化役のLLMに、対象エージェントの初期ハーネス、採点結果、固定された評価予算を渡し、コードを何度か直して最後の候補を1つ選ばせる。その候補は、探索中には見せないテスト部分で初期版からの改善量を測る。信頼できる実行環境が予算を管理し、候補の履歴を保存するため、後から何を変えたかも監査できる。

研究チームは最先端LLM 5種類を、共通のコーディング環境と各モデル固有の環境の両方で、4つの下流課題、合計111回の採点実行により比較した。その結果、成績差は使うコーディング環境より最適化役のモデルによって大きく分かれ、各モデル専用の環境が常に有利とは限らなかった。AIエージェントを導入する人には、モデル名だけでなく、道具や指示の組み合わせを同じ予算で比べる考え方が役立つ。

ただし具体的な改善幅は課題と初期設定で大きく変わり、4課題だけで一般的な優劣は決められない。コードとデータは公開予定とされ、現時点では未査読である。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.AI、プレプリント)を開く