ChatGPT対話・文章確認済み
OpenAI、攻撃役AI「GPT-Red」公開——GPT-5.6のプロンプト注入失敗を大幅削減
OpenAIが安全性向上用の自動レッドチームAIを発表。人手だけでは追いつかない攻撃例づくりを自動化する。
自分にどう関係する?
AIにファイルやWeb操作を任せるほど、プロンプト注入対策が実用上の信頼性を左右する。
ニュースをやさしく解説
結論から言うと、OpenAIはAIを攻撃して弱点を見つける専用モデル「GPT-Red」を発表し、GPT-5.6の安全対策に使った。2026年7月15日の公式発表によると、GPT-Redはプロンプト注入のような攻撃を自分で試し、失敗例を集めて本番モデルの訓練に戻す内部向けの自動レッドチームAIだ。
具体的には、メール、Webページ、ファイル、ツール出力などに紛れた悪意ある指示を想定し、攻撃役と防御役を同時に鍛える自己対戦で学習した。OpenAIは、GPT-Redが新しい間接プロンプト注入環境で人間の13%に対し84%のシナリオで成功攻撃を見つけたと説明している。
またGPT-5.6 Solでは、4カ月前の最良本番モデルより難しい直接プロンプト注入ベンチで失敗が6分の1になり、GPT-Redの広い環境では失敗率0.05%まで下がったという。ユーザーに関係するのは、ブラウザやコネクタを使うAIほど外部データにだまされる危険があり、その守り方が製品品質の中心になる点だ。
注意点は、GPT-Red自体は悪用を避けるため外部提供されず、詳細なプレプリントも後日公開予定で、現時点の数値はOpenAIの内部評価に基づくことだ。
PR
AIをもっと深く学べる本
ニュースに出てきたAIやカテゴリに近い教材を優先しています。
- Amazon評価順で探す ↗Amazon|ChatGPT・Claude・Geminiの生成AI入門書を評価順で探す主要AIをまとめて学び、仕事や学校の使い方まで整理したい人向けChatGPT・Claude・Geminiなどの入門書をレビュー評価順で確認できます。価格・在庫・レビューはAmazon側で確認してください。
- Amazon評価順で探す ↗Amazon|生成AIプロンプト・仕事効率化の本を評価順で探すメール・議事録・資料作成など、毎日の仕事にAIを使いたい人向けプロンプト、業務改善、Office/Google Workspace活用の本をレビュー評価順で確認できます。購入前に内容と対象レベルを確認してください。
- OpenAI楽天で見る ↗OpenAI GPT-5 / ChatGPT 人工知能プログラミング実践入門ChatGPTを使ったプログラミング実践を学びたい人向けOpenAI/ChatGPTを題材に、人工知能プログラミングの実践へ進むための教材。コードカテゴリに向きます。
広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。
広告