MIST・SCOPE(AI研究)検索・リサーチ確認済み

arXiv論文:正しいAIも誤ったヒントで答えを変更——1000問×4条件、全モデルで弱点を確認

同じ問題に正しい・誤り・無関係の文脈を加えるMISTを公開。何でも無視せず必要な情報だけ信じる学習法SCOPEも提案した。

  • 2026-08-08
  • 最終確認日 2026-08-08
自分にどう関係する?

検索結果や資料に誤りが混ざると強いAIも答えを変えます。重要判断では引用元を開いて根拠を確認してください。

ニュースをやさしく解説

結論から言うと、AIが単独では正解できる問題でも、もっともらしい誤ったヒントを添えると答えを変えてしまい、逆に全ての外部情報を無視するだけでも役に立たないことを測る研究が出た。2026年8月6日にarXivのcs.CLへ投稿された未査読論文は、評価データ「MIST」と学習法「SCOPE」を提案した。

MISTは1000問を、追加情報なし、誤ったヒント、正しいヒント、関係はあるが答えに不要な情報という4条件にし、計4000行で比べる。800問は既存の数学・知識・推論評価を基にし、200問はSTEM分野の学位を持つ担当者が長い場面として作成し、別工程で正解、曖昧さ、情報漏れを確認した。

GPT-5.5は追加情報なしで96.0%正解したが、誤ったヒント付きでは86.1%へ低下し、元は正解だった問題が誤答へ変わる割合は10.5%。Gemini 3.1 ProやClaude、公開モデルを含む全モデルで低下が見られた。

SCOPEは4条件を同じ割合で学び、Qwen3-4Bでは誤答への反転率を35.0%から16.3%へ下げつつ、4条件平均を86.9%から92.0%へ上げた。検索や社内資料をAIに渡す人には、情報を付ければ必ず正確になるわけではないと分かる。ただし公開問題を基にした800問は学習済みの可能性があり、単一の生成設定で測った査読前研究である。

重要な回答は、引用元とAI自身の知識を分けて確認したい。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.CL、未査読プレプリント)を開く