AI Topica

ニュース

OpenAIが蒸留攻撃「阻止」と発表、同じ手口はMicrosoft Azure上で数週間通っていた

AI企業が「攻撃を阻止した」と発表したとき、その安心は自社が提供するサービス全体に及ぶのでしょうか。OpenAIが7月の蒸留攻撃を抑え込んだと公表した裏で、同じ手口がMicrosoft Azure経由では9月末まで通り続けていたことが明らかになりました。

何が起きたか

OpenAIは、2026年7月に発生した組織的な「蒸留」攻撃を7月28日までに阻止したと発表しました。攻撃は7月1日に少数のユーザーから始まり、7月24日から25日にかけて4000人以上のユーザーから1万6000件のリクエストが送られる規模まで急拡大したといいます [1][2]。さらに調査を進めた結果、関連するパターンを持つ1万5000以上のアカウントからなるネットワークが確認されました [1]。OpenAIは、活動の中心を担った人物がKimiを開発する中国企業Moonshot AIに関係していると推測していますが、観測した全ての攻撃者が単一の発生源に行き着くかどうかは不明としています [1][2]。

攻撃の手口は、ある会話で得た暗号化済みの推論データを別の会話にコピーし、モデルに復号・書き出しさせるというものでした [1]。OpenAIはこの発表の中で、不正なアカウントの禁止やサインアップ手続きの強化、暗号化された推論を他人が再利用・閲覧できてしまう穴の修正を実施したとしています [1]。

しかし、脆弱性を最初に報告した研究者Joachim Schaeffer氏のチームが9月13日に再度調査したところ、OpenAIとAnthropic自身のAPIでは攻撃がブロックされていた一方、Microsoft Azure上では確認対象とした全てのOpenAIモデル(新モデルGPT-6 Astraを含む)と、Anthropicの一部モデル(Sonnet 5まで)に対して攻撃がそのまま成功したと報告されています [1]。1回の試行だけで推論内容を一字一句抜き出せたといいます [1]。

背景・解説

「蒸留」とは、強いAIモデルの出力を弱いモデルに学習させ、同等の能力を持つモデルを仕立てる学習手法です。ここでいう出力には最終回答だけでなく、そこに至る思考過程(推論)の全体が含まれます。OpenAIによれば、この中間ステップには最終回答からは意図的に省かれた情報が含まれることがあり、他社がモデルの能力を再現する手がかりになり得るといいます [1]。禁止されているにもかかわらずこうした蒸留を行う行為は「敵対的蒸留」と呼ばれます [2]。

推論データは、利用者に対して暗号化されたパケットとして返され、利用者は次のリクエストと一緒にそのパケットを送り返す仕組みになっています。研究者らは、この暗号化に共有鍵が使われているため、パケットをセッション間やユーザー間、さらには同じ系列の別モデル間でも移動させられることを突き止めました。これにより、安価なモデルを「復号オラクル」として使い、高性能モデルの隠れた思考をそのまま印刷させることが可能になっていたといいます [1]。

もう一つ、より単純な手法もあります。モデルに仮想のメモ帳をツールとして与え、そこに推論を書き出させてから利用者が読み取るという方法で、開発者のCan Bölük氏が公に実演しました。この手法はOpenAIの全モデルとAnthropicのOpus 4.8、Sonnet 5で機能し、Opus 5、Fable 5、Fable 5.1だけが推論を明かさなかったと報告されています [1]。

仕事や業務への影響 — AI Topicaの見方

Azure経由でAIモデルを使っている企業ほど、OpenAIの「阻止した」という発表をそのまま自社の安全確認に使うべきではありません。研究者の報告によれば、Azure上の保護が追加されたのは9月27日、Anthropicモデル分の修正確認は9月28日からで、それまでの数週間、Azure経由では推論データが読み取られ得る状態が続いていたことになります [1]。例えば、Azure上でGPT系モデルを呼び出して社内の契約書レビューや見積もり作成を自動化している情シス部門が1つあったとすれば、その期間は競合や外部の第三者がシステムの出力ロジックに相当する推論過程を丸ごと抜き取れる状況にあったということです。

企業がAI活用を検討する際は、同じモデル名であっても提供元のAPIを直接使うのか、クラウド経由で使うのかによって防御レベルが異なるという事実を踏まえるべきです。契約しているクラウド事業者が、モデル提供元と同等のセキュリティ対策を適用しているかどうかを調達担当者が確認する作業は、もはや省略できません。15000以上のアカウントが関与した攻撃を7月28日に止めたという実績があっても、別の経路では同じ穴が9月末まで残っていたという事実は、ベンダー1社の発表だけで安心材料とするには不十分であることを示しています。

不確かな点・注意

OpenAIの発表には、観測された1万6000件のリクエストなどは「試行」であって、必ずしも推論の抜き取りに成功したことを意味しないという注記が付いています [1]。また、期間中に観測された攻撃者が全て単一の組織に属していたかどうかは、OpenAI自身も断定していません [1][2]。GIGAZINEの報道では、今回の件はChatGPTの個人ユーザーの情報が侵害されたものではないと説明されています [2]。

研究者側は、これまでの修正を「断片的で表面的」と評しており、特定のリクエストパターンに頼った対策は崩れやすいと指摘しています [1]。OpenAIもパートナー企業がホストするモデルに自社と同等の保護が必要だと認めており、対応が完了したとは述べていません [1]。クラウド経由の利用を含めて、どの範囲まで安全性が担保されているかは、現時点でも不透明な部分が残っています。

出典

  1. OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on Azure
  2. OpenAIが「中国のAI企業が1万5000以上のユーザーを使ってモデルの思考を盗み取る蒸留攻撃を実行していた」と報告

AI Topica 編集部