メインコンテンツへスキップ
Diditが750万ドルを調達、本人確認と不正対策のインフラを構築
Didit
ブログ一覧へ
ブログ2026年8月4日

ヒドラアカウント問題:蒸留防御がID解決から始まる理由 (JA)

Anthropic社は、約24,000の不正アカウントを通じて1,600万回のやり取りがあったと報告しており、あるプロキシネットワークは20,000以上のアカウントを同時に運用していました。蒸留はプロンプトの問題ではなく、アクセスの問題です。.

By Didit更新日
llm-distillation-defense-identity.png

2026年2月23日、Anthropic社は、それまでAI業界が抽象的に議論していた事柄について、具体的な数値を発表しました。特定された蒸留キャンペーンにおいて、同社はラボが「約24,000の不正アカウントを通じてClaudeと1,600万回以上のやり取りを行った」と報告しました。このレポートのある詳細が、問題全体を再構成します。「単一のプロキシネットワークが20,000以上の不正アカウントを同時に管理していた」

2万のアカウント。1つのアクター。

これが脅威の形です。敵対的蒸留(フロンティアモデルの出力を利用して、より安価なコピーを訓練すること)は、1つの不審なアカウントが1つの不審なリクエストを行うことによって実行されるわけではありません。それは、単一の抽出キャンペーンを数千のアカウント、決済手段、デバイス、ネットワークパスに分散させる組織によって実行され、個々のアカウントはどれも目立たないように見えます。一つずつレビューしても、どれも引っかかるものはありません。グラフとしてレビューすると、それらは1つの機械です。

これが、防御がモデル内やトラフィック内だけで完結できない理由です。これらの層では答えられない質問にも答える必要があります。それは、これらのアカウントの背後に実際にいるのは誰か?という質問です。

主なポイント

  • Anthropic社は、特定された蒸留キャンペーンにおいて、約24,000の不正アカウントを通じて生成された1,600万回以上のやり取りを報告し、単一のプロキシネットワークが20,000以上のアカウントを同時に運用していました。
  • 蒸留は、単一のリクエストの問題ではなく、協調的なアクセスの問題です。アカウントごとのレビューでは、構造的にこれを見逃します。
  • Frontier Model Forumの2026年2月のイシューブリーフは、敵対的蒸留とその手法を定義しています。意図的に脅威に焦点を当て、制御には焦点を当てていないため、アカウント認証、ID、レート制限、アクセス制御に関する推奨事項はありません
  • Anthropic社自身の緩和策には、検出分類器や行動フィンガープリンティングとともに、「教育機関およびスタートアップアカウントの認証強化」が含まれています。
  • 検証済みアクセス層は、モデル制御ではできない3つのことを行います。それは、匿名性を低減し、個人、デバイス、またはネットワークを共有するアカウントをリンクし、再生されたアカウントを到着時に無効化します。
  • ID検証だけでは、モデル抽出を防ぐことはできません。これは3つの層の1つであり、他の2つを置き換えるものではありません。

実際に何が起こったのか

Anthropic社のレポートは全文読む価値がありますが、アクセス制御を設計する人にとって最も重要な3つの発見があります。

ボリュームは少数のアクターに集中していました。Anthropic社は、「1,300万以上」のやり取りをMiniMaxに、「340万以上」をMoonshot AIに、「15万以上」をDeepSeekに帰属させました。これらは日和見的なスクレイピングではありません。持続的な産業プログラムです。

アカウントは協調しており、その協調はメタデータで確認できました。Anthropic社は、「同一のパターン、共有された支払い方法、協調されたタイミング」が「アカウント間の『ロードバランシング』を示唆している」と説明しました。帰属は「リクエストメタデータとインフラストラクチャインジケーター」から得られました。あるケースでは、リクエストメタデータが「Moonshot社のシニアスタッフの公開プロフィールと一致した」とあります。

プロンプトは途方もない規模で繰り返されました。Anthropic社は、プロンプトのバリエーションが「数百の協調アカウントで数万回」到着したと指摘しました。

これら3つを合わせて読むと、あるパターンが浮かび上がります。これらのキャンペーンを明らかにしたほぼすべてのシグナルは、関係性を示すシグナルでした。つまり、アカウント間で共有されているものです。共有された支払い方法。共有されたタイミング。共有されたインフラストラクチャ。共有されたプロンプトテンプレート。分析の単位が単一のアカウントである場合、これらのどれも視認できません。

なぜアカウントごとのレビューが失敗するのか

ほとんどの不正利用ツールは、アカウントごとの判断を中心に構築されています。アカウントが登録され、スコアリングされ、リスクバンドが割り当てられ、決定が下されます。このモデルは、盗まれたカードを使用する詐欺師や、チャンネルにスパムを送りつけるスパマーなど、設計された不正利用に対してはうまく機能します。

しかし、蒸留に対しては、特定の構造的な理由で失敗します。それは、攻撃者が単一のアカウントがどれだけのキャンペーンを負担するかを制御しているためです。

レビューのしきい値が「5万件の異常なリクエストを行うアカウント」である場合、攻撃者は2万のアカウントを使用してそれぞれ800件のリクエストを行います。しきい値が下がると、彼らはアカウントを追加します。アカウントはシステム内で最も安価な入力であるため、経済的には彼らに有利です。フロンティアモデルのAPI呼び出しには実際の限界費用がかかりますが、メールアドレスにはかかりません。

したがって、攻撃者の最適化問題は単純です。アカウントごとの動作を、アカウントごとのしきい値以下に保ち、水平にスケールすることです。そしてそれは機能します。なぜなら、防御側が間違ったオブジェクトを測定しているからです。敵対者がアクターであるのに、アカウントを測定しているのです。

これがヒドラの特性です。1つのアカウントを切り落としても、さらに2つが現れます。なぜなら、アカウントを生成する本体には手が触れられていないからです。Anthropic社が報告したように、2万以上のアカウントを同時に運用するプロキシネットワークは、その純粋な表現です。その規模では、アカウントを1つずつ削除することは防御ではなく、単なるメンテナンス作業です。

ヒドラを倒すには、首を切り落とすのをやめ、本体を見つけ始める必要があります。

蒸留防御の3つの層

本格的な防御には3つの層があり、それぞれ異なる主体が所有しています。

所有者役割
モデル制御モデルプロバイダー機密性の高い推論トレースを制限し、出力を形成し、モデルの動作を保護する
トラフィック検出モデルプロバイダー、または研究/ベンダーのスタック繰り返される、意味的に集中した、または協調的な抽出パターンを検出する
検証済みアクセスIDインフラストラクチャアカウントの背後にいる人物を特定し、共有される識別子をリンクし、確認された不正利用者に関連するすべてにポリシーを適用する

最初の2つの層はよく理解されており、活発に研究されています。トラフィック側では、最近の学術研究は本当に心強いものです。Liu、Guo、Dong(arXiv 2606.05725、2026年6月)は、抽出監視を、良性トラフィックのみで校正された意味空間における最大平均乖離を用いた、良性校正済みトラフィックウィンドウ分布テストとして捉えています。4つの抽出シナリオからの14の攻撃者-正常クエリペア全体で、良性クエリに対する0.3%の偽陽性率で、純粋な攻撃者のケースで100%の検出率を報告しています。

これは強力な結果であり、それが何を意味するかを明確にすることが重要です。つまり、トラフィック検出は機能し、それはDiditが話している層ではありません。プロンプト分布の意味分析はモデルプロバイダーの仕事であり、そこにとどまるべきです。

3番目の層は、業界自身の脅威に関する標準的なブリーフを含め、設計ガイダンスが最も公開されていない層です。

標準ブリーフがカバーする内容

Frontier Model Forumは、Anthropic社のレポートと同じ日に敵対的蒸留イシューブリーフを発表しました。これは優れた文書です。敵対的蒸留を、モデルの出力を密かにアクセスすること(通常は利用規約違反)と定義し、教師モデルの能力を複製する二次モデルを訓練するが、その安全訓練を迂回する、と述べています。それは手法をカタログ化しています。思考連鎖の抽出、思考連鎖の批評、思考連鎖の自動採点、強化学習のためのプロンプト生成、合成データ生成。それはターゲットとなる能力を挙げています。数学的および科学的推論、エージェント的コーディング、マルチモーダル処理、一般的推論。

また、この分野における真の緊張、つまり「正当な研究を妨げることなくこれらのセキュリティ懸念に対処する」ことも認めています。

しかし、アカウント認証、ID解決、レート制限、またはアクセス制御に関する推奨事項は含まれていません。

これはスコープの選択であり、賢明なものです。このブリーフは脅威とその手法を定義することを目的としており、制御を規定するものではありません。アクセス層の設計は、単に別の文書なのです。

しかし、それは業界がまだ実際に書いていない文書です。脅威を測定したラボは、検出分類器や行動フィンガープリンティングと並んで、「教育機関およびスタートアップアカウントの認証強化」を投資する緩和策として挙げていました。アクセス層は実際に実務で機能しており、それに対する設計ガイダンスはほとんど公開されていません。この投稿の残りの部分は、そのことについてです。

検証済みアクセス層が実際に行うこと

この分野全体が信頼性を失うのは、過剰な主張をするからです。ここでは、主張について正確に述べます。

ID検証は蒸留を検出しません。プロンプトの意味を見ることはできず、どの機能がターゲットになっているかを知ることもできません。また、リクエストストリームが思考連鎖の抽出のように見えると教えてくれることも決してありません。それはトラフィック層の仕事です。

IDが行うことは、攻撃者のコスト構造を4つの特定の点で変更することです。

匿名性を低減します。検証済みの個人または登録済みの企業に紐付けられたアカウントは、帰属可能な所有者を持つアカウントです。これは不正利用を阻止するものではありませんが、不正利用のコストとリスクを変更します。

物理的なものを共有するアカウントをリンクします。同じ顔、同じデバイス、または同じネットワークによって登録された2つのアカウントは、その動作が関連しているように見えなくても関連しています。これはアカウントごとのレビューでは生成できないシグナルであり、Anthropic社が説明したキャンペーンを明らかにした、共有された支払い方法、共有されたタイミング、共有されたインフラストラクチャといったシグナルのクラスと完全に一致します。

再生をコストのかかるものにします。ヒドラの特性は、新しいアカウントが安価で、古いアカウントから切り離されていることに依存します。確認された不正利用のケースが、それに触れたすべての識別子(顔、デバイス、IP範囲、メール、電話)に伝播すると、同じインフラストラクチャから作成された次のアカウントは、800件のリクエスト後に捕捉されるのではなく、入り口で失敗します。

正当な開発者への摩擦を軽減します。これが全体を機能させる制約です。全員に適用される検証は成長税です。アクセス層、クォータ、クレジット量、地理、またはトラフィック層からの行動アラートによって適応的に適用される検証は、リスクに摩擦をかけ、信頼された開発者パスを高速に保ちます。

4つのこと。そのどれも「抽出を防止する」ものではありません。しかし、4つすべてが現実的なものです。

Diditの役割

DiditはIDと不正対策のためのインフラストラクチャであり、検証済みアクセス層を構成するプリミティブは、すでに提供しており、価格を公開しています。

  • ID検証 — ID文書、パッシブ生体認証、顔照合、IP分析をバンドルしたもので、検証あたり0.33ドル、毎月500回の無料KYC検証が含まれます。
  • 顔検索1:N — アプリケーションが登録した検証済みユーザー全体での生体認証検索で、検証と無料で利用できます。これは、2つのアカウントを1人の人物にリンクするプリミティブです。
  • IP&デバイス分析 — 0.03ドルで、0.33ドルのバンドルに含まれます。DUPLICATED_IP_ADDRESSDUPLICATED_DEVICE_FINGERPRINTDEVICE_RECOVERED_HIGH_CONFIDENCEAUTOMATION_FRAMEWORK_DETECTEDなどのコードを出力します。
  • リストAPI — 12種類のエントリタイプにわたるブロックリスト。確認されたセッションからのブロックリスト化により、そのセッションで取得された識別子(顔、文書、電話、メール、IP、デバイス)が自動的に抽出されます。
  • 生体認証 — 0.10ドルのパスワードなし再認証。特権アクションをベアラートークンではなく、オンボーディングした人間に関連付けます。
  • 法人検証 — 企業あたり2.00ドルから。登記簿調査、最終受益者および役員の抽出、法人スクリーニングは0.20ドル、最終受益者のリンクされたIDチェックは標準のユーザー検証料金で請求されます。組織レベルおよび研究レベルのアクセス用です。

これらをプラットフォームが必要とするポリシーに構成します。構成はアーキテクチャであり、プリミティブは部品です。すべての機能は、統一された/v3/ APIを通じて、公開された価格と最低料金なしで提供されます。一部はPOST /v3/face-search/のような独自のエンドポイントとして、また生体認証のように独自のスタンドアロンエンドポイントを持たないセッションワークフローを通じて提供されます。

ユースケース

フロンティアモデルプロバイダー。高クォータ、高クレジット、研究レベルのアクセスを検証済みの個人または企業に紐付け、無料および低ボリュームの層は摩擦なく利用できるようにします。

AI APIプラットフォームと推論プロバイダー。再販業者やアグリゲーターは、検出スタックを継承せずに不正利用を継承します。アクセス層は、彼らが現実的に所有できる唯一の制御であることがよくあります。

AIコーディングおよびエージェント製品。試用期間の不正利用やクレジットファーミングは、蒸留と同じアカウント増殖メカニズムを使用します。同じリンクプリミティブが両方に対処します。

クラウドAIプラットフォームとマーケットプレイス。組織レベルの検証は、エンタープライズクォータが付与される前に「これは実際の企業で、実際の最終受益者がいるのか」という問いに答えます。

よくある質問

ID検証はモデル蒸留を防ぎますか?

いいえ。抽出は、モデルレベルの出力制御と意味的トラフィック検出によって、可能な範囲で防止されます。IDは匿名性を低減し、キャンペーン全体でアカウントをリンクし、再生されたアカウントを早期に無効にします。これは3つの層の1つです。

検証によって正当な開発者が離れていきませんか?

全員に適用した場合のみです。機能する設計は適応型です。リスク、層、クォータ、クレジット量、地理、または行動アラートに基づいて検証します。ほとんどの開発者は検証ステップを見るべきではありません。Diditの再利用可能なKYCは無料なので、ネットワーク上で既に検証されている開発者は、再実行せずにチェックをクリアできます。

Diditはリクエストストリームが蒸留のように見えるかどうかを教えてくれますか?

いいえ。Diditはプロンプトを見ることはなく、リクエストの意味を分析しません。そのシグナルは独自のトラフィック層から来ます。Diditが提供するのは、そのアラートをアクターに紐付けるID解決と、それらに関連するすべてのアカウントに対して行動するための強制プリミティブです。

AIプラットフォームの規模で、これはどのくらいの費用がかかりますか?

検証は成功したチェックごとに料金が設定されており、最低料金はありません。完全なIDバンドルは0.33ドル、IPおよびデバイス分析単体は0.03ドル、顔検索1:Nは無料、生体認証再認証は0.10ドル、法人検証は2.00ドルからです。ポリシーは適応型なので、実際にチェックが必要なアクセスの割合に対してのみ支払います。毎月最初の500回のKYC検証は無料です。

すでに不正対策ベンダーを利用しています。これは何が違うのですか?

ほとんどの不正対策ツールは、アカウントごとの判断を返します。蒸留問題はアクターごとの問題であり、アカウントを1人のアクターにリンクするプリミティブ(独自のユーザー全体での1:N生体認証検索、デバイスとIPの相関、単一の確認されたケースからのすべての識別子へのブロックリスト伝播)は、アカウントごとのスコアリングではできない具体的なことです。

始めませんか?

現在不足しているリンクシグナルを生成するプリミティブから始めましょう。

本人確認と不正対策のインフラ。

KYC、KYB、取引監視、ウォレットスクリーニングを一つのAPIで。5分で統合できます。

AIにこのページの要約を依頼する