中国のAI研究所7社、Claudeの能力を無断抽出か…アリババ・DeepSeek・Moonshotを名指し【Claude AI悪用報告書④・完】

Photo of author

By Global Team

▶ アンソロピックは、中国に拠点を置くAI研究所7社が、Claudeの能力を引き出すための無断蒸留攻撃を行っていたと明らかにした。アリババ関連の攻撃は、1日当たり最大約300万件に達した。

▶ Moonshot AIとDeepSeekは、一部の顧客リクエストを自社モデルで処理せず、Claudeに転送していた。この過程で、中国企業の内部資料やロシア政府データベースのアクセス情報など、機密情報も渡っていた。

▶ 生物学分野では、生物兵器開発に利用される可能性のある研究事例を5件公表した。ただし、関係する科学者に悪意があったと断定せず、研究機関や国、具体的な生物学情報も公開しなかった。

▶ 中国のアプリ開発会社は、20を超えるマッチングアプリで約4,700体のAI人格を運用していた。2週間で少なくとも2万5,000人と、約236万件のメッセージをやりとりした。

アンソロピックは10日(現地時間)、154ページの報告書「AI悪用の検知と対応、2026年9月」を発表した。自社AIのClaudeが悪意ある目的に使われた事例を、自ら公表した文書だ。(写真=アンソロピック)
アンソロピックは10日(現地時間)、154ページの報告書「AI悪用の検知と対応、2026年9月」を発表した。自社AIのClaudeが悪意ある目的に使われた事例を、自ら公表した文書だ。(写真=アンソロピック)

【編集者注】AIの悪用は、もはや可能性の問題ではない。ハッキングやスパイ活動、世論操作、監視から、兵器や生物学研究に至るまで、実際の利用事例が現れている。アンソロピックが公表した154ページの報告書は、AIが従来の脅威の速度と規模をどのように変えているかを示している。本紙は同報告書をもとに、AIが犯罪や国家作戦の道具として使われる実態を追う。

AIの危険は、ハッキングやフェイクニュースにとどまらない。

アンソロピックの報告書の後半には、生物学研究や詐欺、競合AIモデルの能力をひそかに引き出そうとした事例が記されている。特に最終章で名指しされたのは、中国に拠点を置くAI研究所7社だ。アリババ、Moonshot AI、DeepSeek、智譜(Zhipu)、シャオミ、センスタイム、MiniMaxが含まれている。

手口もさまざまだった。数千の偽アカウントを使ってClaudeに大量のリクエストを送りつけたり、他の利用者の会話記録を買い取ったりした。自社AIを使う顧客のリクエストをClaudeに送り、学習資料として利用した例もあった。その過程で企業の内部資料や政府機関の情報までアンソロピックに渡っていた。

◆ 生物学研究の事例は5件…機関・国名は非公表

アンソロピックは、生物学分野で悪用される可能性のある事例を5件公表した。ただし、研究機関や国、具体的な生物学情報の大半は伏せた。事例に登場するのは現役の科学者であり、彼らに危害を加える意図があったとは断定できないためだ。

△最初の事例では、チクングニアウイルスの機能獲得研究が取り上げられた。今年5月、Claudeの生物安全システムが関連する研究助成申請書の作成を阻止した。機能獲得研究とは、生物を遺伝的に改変し、新たな性質や強化された特性を持たせる研究だ。

調査の結果、リクエストは複数の生命科学研究者が利用するAI仲介プラットフォームから寄せられていた。利用者はアンソロピックがサービスを提供していない地域におり、プラットフォームは米国のインフラを経由して地域制限を回避していた。申請書上では研究者は民間の研究者に見えたが、実際の研究は軍の研究機関で行われる予定だった。アンソロピックは研究内容と機関との関係を踏まえ、追加調査に着手した。

プラットフォームには、Claudeが拒否したリクエストを別の企業のAIに送る機能もあった。この機能を実装するコードのかなりの部分はClaudeが書いたものだった。開発者はClaudeに対し、これを「過剰な拒否を減らすための機能」と説明していた。

利用停止だけでは終わらなかった。アンソロピックによると、運営者は数日後に再びアクセスし、関連研究も継続した。その後に確認された研究資料を根拠に、アンソロピックは研究が助成申請の段階にとどまっていたわけではないと判断した。

△2番目の事例では、高病原性鳥インフルエンザの哺乳類への適応研究にClaudeが使われた。研究者は数週間にわたって数千件のメッセージをやりとりし、研究設計やデータ分析、実験の優先順位付けなどで支援を受けていた。ただし、高リスクの生物学的内容を遮断する安全対策が作動したため、Sonnet 4やHaiku 4.5など、比較的性能の低いモデルしか利用できなかった。

アンソロピックはこの事例について、Claudeが提供した支援は主にデータ分析や研究アイデア、設計などの補助にとどまったと評価した。研究も非常に初期の段階だったとしている。

△3番目の事例では、約12人の顧客にサービスを提供していた仲介アカウントを通じて、Opus 5がオルトポックスウイルスの免疫回避に関する研究助成申請書を、約1時間で丸ごと作成した。

残る2件は毒素に関する研究だった。△ある研究者は、新たな鎮痛薬や抗うつ薬などの治療薬開発を目的に毒素ペプチドの資料を整備していたが、麻痺作用に関わる標的も扱っていた。△別の研究者は複数の毒素をコンピューター上で再設計し、四半期ごとの進捗報告書では、細菌毒素やウイルスタンパク質の正体を意図的に曖昧にするようClaudeに指示していた。

アンソロピックは、こうした事例が生物学分野の根本的な問題を示しているとみている。ワクチンや治療薬の開発に必要な情報は、同時に危険な研究にも利用され得るためだ。技術的な内容だけから利用者の意図を正確に見分けることは難しく、高リスクの内容を遮断するシステムだけでは不十分だと結論づけた。

◆ 20超のマッチングアプリでAI人格4,700体

詐欺の項目では、中国のアプリ開発会社が摘発された。報告書のコードはGTG-15001。同社は20を超えるマッチングアプリを開発し、アプリ内ではClaudeがAI人格を担って利用者と会話していた。しかし、サービスは登場人物が全員実在の人間であるかのように宣伝されていた。

今年4月の2週間に確認されたAI人格は4,700体を超えた。少なくとも2万5,000人と、約236万件のメッセージをやりとりしていた。自然なやりとりを強調するため、実際の人間も投入されていた。AI人格約3体に対し、実際の人間が1人という割合だった。

人間は、ビデオ通話やソーシャルメディアでのフォローなど、AIが直接できないことを担当した。利用者に相手を実在の人間だと信じさせる役割だった。別のAIモデルは実際の人間に送る短い返信を提案し、別の画像モデルはプロフィール画像の作成に使われた。

AI人格には、自分が自動化されていることを明かさず、ビデオ通話や写真の要求を避けるよう指示されていた。実際の人間が不在の場合には、偽の「いいね」や閲覧履歴、事前に録画した動画も利用された。利用者が相手をボットだと疑い始めているかどうかも、別途追跡されていた。

アンソロピックが一部の会話を調査したところ、Claudeが問題のある状況を認識していた形跡もあった。利用者が重い病気や深刻な苦痛を打ち明けたケースが含まれていた。それでもClaudeは会話を打ち切らず、設定された人格を保ったまま返答を続けた。

◆ 中国のAI研究所7社、Claudeの能力抽出を試みる

報告書の最終章では「無断蒸留」を扱った。蒸留自体は正当なAI学習手法だ。性能の高い「教師モデル」の回答を使い、より小さな「生徒モデル」を訓練する。少ないリソースでモデルの性能を高められるため、AI業界で広く使われている。

問題は、他社モデルの能力を許可なく引き出す場合だ。アンソロピックは無断蒸留を、モデルの能力を産業規模でひそかに抽出し、別のモデルに複製する行為と定義した。今年2月に初めて公表して以降、中国に拠点を置く研究所7社による追加攻撃を確認したという。

各社はプロキシサービスを利用したり、数千の偽アカウントを作成したりしていた。第三者から利用者とAIの会話記録を買い取るケースもあった。自社利用者のリクエストをひそかにClaudeへ送り、回答や推論に関する資料を入手した事例も確認された。

◆ アリババ、3カ月で1億5,100万件

最も大規模だったのはアリババ関連の攻撃だ。報告書のコードはGTG-16005。標的はOpus 4.6と4.7の推論過程だった。Claudeが回答を出すまでの思考過程を抽出し、学習資料にする手法だ。

攻撃が最も多かった時期には、1日当たり約300万件に達した。3,500を超える偽アカウントが使われた。アンソロピックによると、収集された資料は、アリババのQwen 3.5、3.6、3.7にClaudeの能力を移すために使われた。今年5月から7月にアリババに帰属するとされたリクエストは、1億5,100万件を超えた。

アクセス方法も組織的だった。最初に使われたアカウント群だけで約5,000件あった。住宅用プロキシや使い捨てメール、バーチャルカードを利用して接続元を隠していた。アンソロピックがこのアカウント群を遮断すると、すぐに別のアカウント群へトラフィックを移した。

アリババは自社AIの研究にもClaudeを利用していた。強化学習環境やモデル開発インフラの構築、モデル構造の研究などに使っていたことが調査で判明した。

◆ 「Kimi」を使っていたのに、回答はClaude

Moonshot AIの事例は手口が異なっていた。報告書のコードはGTG-16002。アンソロピックの調査によると、Moonshotは一部顧客のリクエストを自社AI「Kimi」ではなくClaudeに送っていた。利用者はKimiを使っていると思っていたが、実際にはClaudeが作成した回答を受け取っていた。

確認された期間は10日間だった。この間に顧客のリクエスト約30万件がアンソロピックに送られ、その大半はOpusに転送された。Moonshotは一部の会話も保存していた。その後、Claudeの推論記録を引き出し、モデル学習に活用するためのシステムを構築した。

Claudeが内部推論をそのまま出力しないようにする仕組みも回避した。以前の応答に残っていた推論関連の情報を新たな会話で再利用し、推論記録全体を引き出す手法だった。

顧客が入力した機密情報も一緒に渡っていた。アンソロピックが人民解放軍と関係している可能性があると判断したある利用者は、Kimiを使っていると思い、特定人物の監視カメラ映像に関する情報を入力した。そのリクエストもClaudeに転送された。アンソロピックは、Moonshotが顧客にこの事実を知らせていたかどうかは確認できなかったとしている。

◆ DeepSeek経由でロシア政府のアクセス情報が流出

DeepSeekでも同様の事例が確認された。報告書のコードはGTG-16001。DeepSeekは一部利用者のリクエストをClaude Opusに転送していた。アンソロピックは、機密情報が利用者の認識や同意なく渡された可能性が高いと判断した。

中国のテクノロジー企業の内部資料も含まれていた。ある従業員はDeepSeekを利用していると思い、主要なAI事業の詳細仕様や組織構造、戦略目標などを入力していた。これらの資料もClaudeに転送された。

ロシア政府関連の資料もあった。ロシア国防省と関係する政府機関のデータを扱っていたIT担当者のリクエストがClaudeに送られ、その過程でロシア政府データベースの実際のアクセス情報が露出した。

中国の地方公安局の事件管理システムを開発していたエンジニアのリクエストも転送された。このシステムには、住民登録番号を使って個人の移動記録と警察記録を照合する機能があった。DeepSeek関連のリクエストは、今年7月の14日間で1,210万件を超えた。

◆ 智譜、Fableを狙うも断念

智譜の事例では、安全対策の効果も明らかになった。報告書のコードはGTG-16006。智譜はClaudeの推論記録を抽出し、自社のGLMモデルの訓練に利用していた。6月の10日間に推論記録を整理する過程で、約77万件のリクエストが確認された。

同じ期間に智譜と関連するリクエストは、全体で300万件を超えた。その後、智譜は次期モデルGLM 5.3を準備するにあたり、米国の主要なフロンティアモデルのサイバー能力を標的にした。

当初はアンソロピックのFableを狙った。しかし、Fableに導入されていた強化型のサイバー安全対策によって攻撃の効果が低下したため、智譜はFableを断念した。その後、安全対策がより弱いと判断したOpus 4.6や、別の米国AI研究所のモデルへ標的を切り替えた。

◆ シャオミ、センスタイム、MiniMaxも摘発

シャオミも自社利用者の会話をClaudeに再入力していた。報告書のコードはGTG-16008。シャオミはMiMoの利用者の会話やコーディング作業を保存し、それをClaudeに再現させていた。今年3月から4月にかけての20日間に、1,500を超えるアカウントを通じて40万件以上のリクエストが送られた。

この過程には、氏名や連絡先、企業資料など、利用者の機密情報も含まれていた。アンソロピックは、シャオミがClaudeの回答を顧客にそのまま提供した形跡は見つけられなかった。その代わり、会話内容を学習資料にするために活用していたと調査で判明した。

センスタイムは別の経路を使った。第三者のデータ販売業者から、利用者とClaudeの会話記録を購入し、モデルの蒸留に利用していた。Claudeを使って蒸留システムを構築し、学習作業を実行・管理することもあった。

MiniMaxはペーパーカンパニーを通じて独自のプロキシサービスを構築した。このサービスではアンソロピックとOpenAIのモデルだけが利用でき、MiniMax自身のモデルを含む中国のモデルは提供されていなかった。アンソロピックは、米国のフロンティアモデルと利用者の会話を収集し、自社モデルの訓練に活用するための動きと判断した。

◆ 能力は移せても、安全対策は引き継がれない

アンソロピックが無断蒸留を特に危険視する理由がある。他の研究所がClaudeの能力を取り込んでも、Claudeに適用されている安全対策まで一緒に移るわけではないからだ。

アンソロピックは、一般的な推論能力を蒸留するだけでも、生物学やサイバー分野の危険な能力が高まる可能性があるとみている。学習に使われた会話が、そうした分野を直接扱っていない場合も同様だと説明した。

プライバシーの問題も指摘した。DeepSeek、シャオミ、Moonshotは自社モデルの利用者の会話をClaudeに送っていた。その一部には、個人や企業、国家機関に関する機密情報が含まれていた。アンソロピックは、こうした慣行は個人情報保護法や各社の利用規約に違反する可能性が高いと述べた。

対策も強化した。プロキシアカウントを一つずつ遮断するのではなく、背後にいる組織を特定して関連アカウントをまとめて遮断する。無断抽出を検知する専用の分類器も運用している。また、Claudeが内部推論をそのまま露出させず、要約する仕組みも追加した。

Fable 5.1には「preserved thinking(思考の保持)」機能を導入した。新しいAPIアカウントが、複数回にわたる会話の中で、Claudeの推論に先行するシステムプロンプトやツール、メッセージを変更できないようにする機能だ。

◆ シリーズを終えて

アンソロピックの154ページの報告書を、4回にわたって取り上げた。報告書は昨年12月から今年8月までに検知・阻止した事例を収録している。サイバー攻撃から世論操作、監視、通常兵器、生物学、詐欺、モデル蒸留まで、7つの分野を扱った。

今回公表された事例が、Claudeの利用全般を代表するわけではない。アンソロピックも、これまでに確認した事例のうち、特に注目すべきものや新しい類型を選んで公表したと説明している。確認できていない点や、可能性として判断した内容についても、報告書ではその確度を区別した。

アンソロピックは、今回の公表が他のAI開発企業にとって、自社プラットフォーム上で同様の悪用パターンを見つける助けになることを期待している。また、政府や市民社会が新たな脅威の生まれ方を把握し、共同防衛を強化することも、報告書を発表した目的として挙げた。