米オープンAI(OpenAI)は2026年9月30日、中国の月之暗面(Moonshot AI)関係者によるモデル内部思考プロセスの不正抽出(蒸留攻撃)を遮断したと発表した。2026年に独自基盤モデルのAPI提供を進めるNTTなどの国内事業者にとっても、推論投資で得た知的財産の防護が直近の技術課題となる。
Moonshot AIによる米モデル標的の蒸留作戦と被害の実態
OpenAIの発表によると、今回の攻撃は2026年7月1日に初期の低水準な抽出活動として検知された。標的となったのは、同社が提供する最先端モデルの非公開推論過程(protected reasoning)である。攻撃者はモデルの出力を大量に収集し、自社モデルの学習データとして再利用する「知識蒸留」の手法を悪用した。
活動は2026年7月24日から25日にかけて急増した。2日間のピーク時には、4,000件以上のアカウントから特定の抽出プロンプトを用いたリクエストが16,000件観測された。作戦全体で類似のプロンプトパターンを使用したユーザー群は15,000人規模に達していた。OpenAIは登録プロセスの厳格化とネットワーク監視の強化を実施し、2026年7月28日に一連の攻撃ネットワークを完全に遮断した。
同様の組織的抽出はOpenAIだけでなく米アンソロピック(Anthropic)に対しても行われていた。Anthropicが2026年9月に公表した脅威インテリジェンス報告書によれば、Moonshot AIに関連するプロキシネットワーク(5,380件の不正アカウント)が、わずか10日間で約30万件の顧客リクエストをClaudeに転送・再生していた。
| 項目 | OpenAIへの攻撃事象 | Anthropicへの攻撃事象 |
|---|---|---|
| 検知・観測時期 | 2026年7月1日〜7月28日 | 2026年9月公表(10日間の集中攻撃) |
| 主な標的データ | 推論モデルの内部思考過程(推論トレース) | Claudeの出力データ(対話・タスク応答) |
| 動員アカウント規模 | ピーク時4,000超(作戦全体で15,000超) | 5,380件(プロキシネットワーク経由) |
| リクエスト数 | ピーク2日間で16,000件 | 10日間で約30万件(29万件超) |
| 主な対抗措置 | 登録フロー厳格化、通信監視による遮断 | アカウント遮断、プロキシ通信の検知 |
事態を受け、米サイバーセキュリティ・インフラセキュリティ庁(CISA)は2026年9月8日、中国系AI企業による米AI企業への大規模な知識蒸留活動に関する勧告を発表した。産業規模のモデル蒸留を米国の経済および安全保障上のリスクとして定義し、業界全体に警戒を促している。
参考記事: LLM(大規模言語モデル)の技術的本質と企業導入|RAG・セキュリティ・ROI評価まで徹底解説
推論モデルの「思考トレース」を狙う技術構造と抽出手口
知識蒸留そのものは、巨大な教師モデルの出力を生徒モデルに学習させ、小型軽量なモデルを作る正当な機械学習手法である。従来は質問に対する最終回答のテキストのみを蒸留に用いていた。しかし、推論特化型モデルの登場により、蒸留の標的が「思考プロセス(Chain of Thought: CoT)」そのものへと変化している。
推論特化モデルは、最終的な回答を出力する前に内部で推論ステップを展開する。この推論ステップには、誤りの自己修正や論理展開の分岐など、モデルの性能を決定づけるコアロジックが含まれる。このCoTデータを自前で生成するには膨大な強化学習の計算資源が必要となる。他社の商用モデルから推論ログを直接吸い上げれば、計算コストを数十分の一から数百分の一に抑えて同等の推論能力を持つモデルを複製できる。
OpenAIの報告によると、攻撃者は同社の暗号化を突破したりデータベースへ不正アクセスしたりしたわけではない。APIおよびWebインターフェース経由のプロンプト入力により、通常はマスクされている推論トレースを平文で出力させるようモデルを誘導した。2026年8月には外部のセキュリティ研究者からも、セッション間をまたいで暗号化された推論ログを復号・抽出する手法が報告されていた。
[攻撃者のプロキシネットワーク] (数千件のアカウントから分散送信)
│
▼ 特殊プロンプト (CoT出力を誘導するリクエスト)
[標的モデル (OpenAI / Anthropic)]
│
▼ 本来非公開の推論トレース (思考ステップ) を平文出力
[攻撃者の生徒モデル学習環境] (安価に高性能モデルを複製)
この攻撃を防ぐための技術的必須条件(Prerequisites)は、従来のサイバーセキュリティとは大きく異なる。モデルの推論ロジック自体がプロンプトによって出力を変えるため、境界防御(ファイアウォール)だけでは阻止できない。推論ログの完全な不可視化、トークン生成パターンの異常検知、および単一プロンプトから得られる情報の難読化が不可欠となっている。
参考記事: SLM(スモール言語モデル)とは?LLMとの違い、導入メリットや選定基準をわかりやすく解説
国内基盤モデル開発とAPI提供における知財防護の課題
今回の事象は、海外のフロンティアモデル提供者だけの問題ではない。国内でもNTTの「tsuzumi」をはじめ、独自の基盤モデルをAPI経由で外部提供する動きが本格化している。巨額の研究開発費を投じて構築した自社モデルの推論能力が、正規のAPI利用を装った競合他社によって短期間でコピーされるリスクが現実のものとなった。
利用規約(Terms of Service)による「蒸留目的の利用禁止」だけでは実効性が薄い。Moonshot AIの事例が示すように、攻撃者は数千件規模の分散プロキシや架空アカウントを経由してアクセスしてくるため、法的な追跡や差し止め請求が追いつかない。契約上の制限に頼るのではなく、アーキテクチャレベルでの技術的防衛が必須となる。
また、国内企業が海外製モデルを組み込んだSaaSや独自サービスを構築する際のリスク管理も見直しが求められる。OpenAIやAnthropicが不正抽出を防ぐためにアカウント登録審査を厳格化し、不審な高頻度リクエストに対する遮断基準を引き上げたことで、正規の開発現場においてもAPIのレートリミットや利用停止リスクが急激に高まっている。
参考記事: AIセキュリティとは?NIST基準から学ぶ脆弱性対策と組織防衛の実践ステップ
知的財産としての推論モデルを守る実務対応
自社のAIモデルやAPIサービスを知的財産侵害から守るために、システム開発および運用において以下の防御措置を直ちに見直す必要がある。
1. API出力監視への行動分析エンジンの導入
同一IPや同一組織名による制限だけでなく、プロンプトの類似度クラスタリングとリクエスト間隔の行動分析を組み合わせる。短期間に系統的なパターンで推論ステップを引き出そうとするトラフィックをリアルタイムで検知・隔離する仕組みを構築する。
2. 推論ログ(CoT)の完全非公開化とサニタイズ
内部推論モデルを提供する設計の場合、推論ステップの出力テキストがAPIレスポンスやフロントエンドのHTMLソースに含まれないよう完全に分離する。推論過程を可視化する機能は社内開発環境のみに制限し、商用環境では最終結果のみを返すパイプラインを標準とする。
3. 多段プロキシを前提とした本人確認(KYC)の強化
APIキーの発行プロセスにおいて、開発者アカウントの認証プロトコルを見直す。使い捨てメールアドレスや仮想番号による自動登録を遮断し、商用APIの大量利用時には企業ドメインの検証や二要素認証を必須化することで、ボットネットによる組織的抽出のコストを引き上げる。
出典: 時事通信
出典: OpenAI
出典: CISA
出典: The Hacker News
