研究論文検索・リサーチ確認済み

arXiv論文:AIは古い会話に引っ張られ道具選択を32.1%変更——正しい最新状態を学ぶ方法を提案

見た目は自然でも現在は誤りとなった履歴が道具操作を乱す問題を評価。小型Qwenの正確さを87.0%へ改善した。

  • 2026-08-09
  • 最終確認日 2026-08-09
自分にどう関係する?

長い会話でAIに作業を頼む時は、最新の対象や使う道具を明示し直す方が安全だと分かります。

ニュースをやさしく解説

結論から言うと、AIエージェントは、昔は正しかったが現在は使えない会話や道具の記録に強く引っ張られることがある。2026年8月6日にarXivのcs.AIへ投稿された未査読プレプリント「When History Lies」は、最新の依頼や道具が同じでも、過去の履歴だけを汚す比較評価を行った。

Qwen3-1.7Bでは、元の履歴なら正しかった判断の32.1%が変わり、古い対象名や操作形式を再利用する失敗が多かった。研究チームは、Original、Polluted、Oracle Stateの3種類を対にした評価データと、正しい現在状態を見られる教師AIから、汚れた履歴しか見られない生徒AIへ方針を移す学習法を提案した。

その結果、1.7BモデルのBalanced Tool-Use Accuracyは87.0%となり、Gold-SFTの66.3%やOracle系列蒸留の82.3%を上回った。8B教師を使うと同じ小型モデルは91.9%、8B生徒は93.0%に達した。利用者は、長く続くチャットや自動化で、古い指示を残し過ぎず、現在の対象・道具・目的を明示し直す重要性を理解できる。

ただし結果は特定のモデルと作成条件を含む研究評価で、実製品すべてに同じ割合で起きるとは限らない。未査読のため追加検証も必要だ。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.AI、未査読プレプリント)を開く