ChatGPT対話・文章確認済み

OpenAI、攻撃役AI「GPT-Red」公開——GPT-5.6のプロンプト注入失敗を大幅削減

OpenAIが安全性向上用の自動レッドチームAIを発表。人手だけでは追いつかない攻撃例づくりを自動化する。

  • 2026-07-16
  • 最終確認日 2026-07-16
自分にどう関係する?

AIにファイルやWeb操作を任せるほど、プロンプト注入対策が実用上の信頼性を左右する。

ニュースをやさしく解説

結論から言うと、OpenAIはAIを攻撃して弱点を見つける専用モデル「GPT-Red」を発表し、GPT-5.6の安全対策に使った。2026年7月15日の公式発表によると、GPT-Redはプロンプト注入のような攻撃を自分で試し、失敗例を集めて本番モデルの訓練に戻す内部向けの自動レッドチームAIだ。

具体的には、メール、Webページ、ファイル、ツール出力などに紛れた悪意ある指示を想定し、攻撃役と防御役を同時に鍛える自己対戦で学習した。OpenAIは、GPT-Redが新しい間接プロンプト注入環境で人間の13%に対し84%のシナリオで成功攻撃を見つけたと説明している。

またGPT-5.6 Solでは、4カ月前の最良本番モデルより難しい直接プロンプト注入ベンチで失敗が6分の1になり、GPT-Redの広い環境では失敗率0.05%まで下がったという。ユーザーに関係するのは、ブラウザやコネクタを使うAIほど外部データにだまされる危険があり、その守り方が製品品質の中心になる点だ。

注意点は、GPT-Red自体は悪用を避けるため外部提供されず、詳細なプレプリントも後日公開予定で、現時点の数値はOpenAIの内部評価に基づくことだ。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

OpenAIを開く