Stealing Reasoning Traces検索・リサーチ確認済み

arXiv論文:暗号化したAIの推論記録を別モデルで復号——公開ログ31万件超から認証情報も検出

APIが返す暗号化推論ブロックを弱いモデルへ渡して平文を引き出す攻撃を示し、ログ公開の危険を報告した。

  • 2026-08-12
  • 最終確認日 2026-08-12
自分にどう関係する?

中身を読めない暗号化文字列でも安全とは限らず、AI APIの会話ログを公開しない運用が必要だと分かります。

ニュースをやさしく解説

結論から言うと、AI APIが会話の継続用に返す暗号化済みの推論記録を、同じ提供元の別モデルへ渡して平文を引き出す攻撃が報告された。2026年8月10日にarXivのcs.CRへ投稿された未査読論文で、正式な学会採択は示されていない。対象は、利用者には読めない推論ブロックをクライアント側へ返し、次のAPI呼び出しでそのまま送り直す設計だ。

研究チームは、このブロックが同じ提供元の異なる会話、利用者、モデル間でも交換できる点を利用した。高性能モデルの暗号化ブロックを、保護が弱い別モデルへ入力し、元の高性能モデルを直接攻撃せずに内容を出力させたという。

Anthropic、OpenAI、Googleの環境で推論の取り出しを試し、公開リポジトリから集めた31万5320個のブロックを解析した結果、個人を特定し得る情報367件と認証情報182件を見つけたと報告する。さらに、表の回答では拒否された危険情報や、見えない指示を推論ブロックへ混ぜる問題も示した。

APIを使う開発者には、読めない文字列でも公開ログ、Issue、テストデータへ貼らないこと、会話状態を秘密情報として扱うことが重要だと分かる。ただし数値と再現性は査読前の著者報告で、現在の各社サービスが同じ状態とは限らない。研究者らは責任ある開示を行ったとしており、攻撃の再現ではなくSDK更新、ログ削除、鍵や認証情報の再確認を優先したい。

PR

AIをもっと深く学べる本

ニュースに出てきたAIやカテゴリに近い教材を優先しています。

広告(アフィリエイト)リンクを含みます。最新の内容・料金・在庫・条件は、リンク先の公式ページ・販売ページでご確認ください。

広告

source

出典

提供状況や価格は変わるため、最終判断は公式情報で確認します。

arXiv(cs.CR、未査読・学会採択記載なし)を開く