arXiv論文:同じAIでもWeb検索で正答率が最大8ポイント低下——同じ質問の回答も最大21%不一致
ChatGPTの画面とAPI、検索あり・なしを401問、4812回答で比較。単発の正答率だけでは実際の安全性を測り切れないと示した。
ベンチマーク点だけでAIを選ばず、自分が使う画面・検索設定で複数回試し、引用元まで確認する重要性が分かります。
ニュースをやさしく解説
結論から言うと、同じ系統のAIでも、チャット画面かAPIか、Web検索を使うか、同じ質問を何回試すかによって、安全性テストの結果が大きく変わるとする研究が出た。
2026年8月6日にarXivのcs.HCへ投稿された未査読論文「What Current AI Benchmarks Leave Unmeasured」は、ChatGPTの画面とOpenAI APIを、検索あり・なしで比較した。偏見を測るBBQと安全性を測るSafetyBenchから401問を選び、各条件で3回ずつ試して合計4812回答を集めた。
検索を切った条件では、両評価とも画面版の正答率がAPI版より低かった。Web検索を有効にすると正答率は最大8ポイント下がり、片方の評価では画面とAPIの優劣まで逆転した。同じ質問を繰り返しても、最大21%の質問で回答が一致せず、引用する情報源や回答を控える傾向にも差が出た。
利用者には、AIを選ぶ時に「モデル名と1回の点数」だけを信じず、実際に使う画面、検索設定、複数回の再現性、引用の中身まで確かめる必要があると分かる。ただし対象は1つのモデル系統と2つの評価に限られ、他社AIへ同じ差をそのまま当てはめられない。arXivで公開された査読前研究なので、追試と専門家の検証も必要だ。
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon本評価順で探す ↗Amazon|AI論文・機械学習の入門書を評価順で探すAIニュースや論文ニュースを背景から理解したい人向け機械学習、深層学習、論文読みの入門書をレビュー評価順で探せます。数式レベルと対象読者を確認してください。
- Amazon機器評価順で探す ↗Amazon|AI作業向けモニター・キーボード周辺機器を評価順で探すAIで調査・文章作成・コード作業を長時間行う人向けモニター、キーボード、トラックボールなど作業環境の周辺機器を評価順で確認できます。サイズと接続方式を見てください。
- 対話AI楽天で見る ↗Grok、Monica & ChatGPT完全ガイド複数の会話AIを比べて使いたい初心者向けGrok・Monica・ChatGPTの違いと使いどころをまとめて確認できるムック。会話AIの横断比較に向きます。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。