arXiv検索・リサーチ確認済み

arXiv論文:LLM予測力テストの「答え漏れ」を防ぐHindcast——過去時点の情報だけで採点

予測市場を使ったLLM評価で、未来の記事や訓練データ混入を避けるHindcastベンチが提案された。

  • 2026-07-16
  • 最終確認日 2026-07-16
自分にどう関係する?

AIの予測評価は、答えを知っているだけのモデルを「先読みがうまい」と誤評価しやすい。

ニュースをやさしく解説

結論から言うと、LLMの「未来を予測する力」を測るには、答えが後から混ざる抜け道をふさぐ必要がある。2026年7月15日にarXivへ投稿された「Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters」は、解決済みの予測市場を使う評価で起きる2つの漏れを指摘した。

ひとつは、検索できるモデルが結果発表後の記事を見つけてしまい、予測ではなく答えの検索になること。もうひとつは、新しいモデルほど訓練データが結果日に近くなり、昔のモデルにとって未来だった出来事が学習済み知識に入ることだ。Hindcastは、各市場について過去の基準日t0を置き、その時点以前のReddit投稿だけを凍結スナップショットから読ませる。

モデルの予測は、実際の結果だけでなく、その時点のPolymarket価格、つまり同じ過去情報に基づく人間側の予測とも比べる。論文は、漏れを閉じると検索は多くのモデルで助けになるが、事前にRedditで十分議論されていた場合に限られ、単なる憶測しかない場面では逆に悪化することもあると報告した。

ユーザーに関係するのは、AIの予測力ランキングを見るとき、実は記憶や検索で答えを見ていないかを疑う必要がある点だ。注意点は、対象がPolymarketとRedditスナップショット中心で、ニュース、医療、金融など全領域の予測性能を直接示すものではないことだ。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXivを開く