九头蛇账户问题:蒸馏防御为何始于身份解析 (ZH)
Anthropic报告称,通过大约24,000个欺诈账户进行了1600万次交互,一个代理网络同时运行了20,000多个账户。蒸馏并非提示词问题,而是访问问题。.

2026年2月23日,Anthropic公布了一些数据,这些数据在此之前AI行业大多只是抽象地讨论。在已识别的蒸馏活动中,该公司报告称,实验室“通过大约24,000个欺诈账户与Claude进行了超过1600万次交互。”该报告中的一个细节重新定义了整个问题:“一个单一的代理网络同时管理了20,000多个欺诈账户。”
两万个账户。一个行为者。
这就是威胁的形态。对抗性蒸馏——利用前沿模型的输出训练其廉价的复制品——并非由一个可疑账户发出一个可疑请求来执行。它是由一个组织进行的,该组织将单一的提取活动分散到数千个账户、支付工具、设备和网络路径中,使得每个单独的账户看起来都平平无奇。逐一审查时,它们都不会触发任何警报。作为图谱审查时,它们是一台机器。
这就是为什么防御不能只存在于模型中或只存在于流量中。它还必须回答这些层面无法回答的问题:这些账户背后到底是谁?
主要收获
- Anthropic报告称,在已识别的蒸馏活动中,通过大约24,000个欺诈账户产生了超过1600万次交互,其中一个单一的代理网络同时运行了20,000多个账户。
- 蒸馏是一个协同访问问题,而非单一请求问题。逐账户审查对此结构性地视而不见。
- 前沿模型论坛2026年2月的议题简报定义了对抗性蒸馏及其方法。它旨在针对威胁而非控制措施,因此未就账户验证、身份、速率限制或访问控制提出建议。
- Anthropic自身列出的缓解措施包括“加强教育和初创账户的验证”,以及检测分类器和行为指纹识别。
- 验证访问层可以做到模型控制无法做到的三件事:它降低了匿名性,它将共享同一人物、设备或网络的账户关联起来,并且它使重新生成的账户一创建即失效。
- 仅靠身份验证无法阻止模型提取。它是三层之一,不能替代其他两层。
实际发生了什么
Anthropic的报告值得全文阅读,但对于任何设计访问控制的人来说,有三个发现最为重要。
大部分流量集中在少数行为者。Anthropic将“超过1300万”次交互归因于MiniMax,“超过340万”次归因于Moonshot AI,“超过15万”次归因于DeepSeek。这些并非机会主义的抓取,而是持续的工业化项目。
这些账户是协调的,且协调行为在元数据中可见。Anthropic描述了“相同的模式、共享的支付方式和协调的时间安排”,这“暗示了账户间的‘负载均衡’”。归因来自于“请求元数据和基础设施指标”——在一个案例中,请求元数据“与Moonshot高级员工的公开资料相匹配”。
提示词以荒谬的规模重复出现。Anthropic指出,提示词变体“通过数百个协调账户出现了数万次”。
将这三点结合起来看,一种模式浮现。几乎所有揭示这些活动的信号都是关联性信号——账户间共享的某些东西。共享的支付方式。共享的时间。共享的基础设施。共享的提示模板。如果你的分析单位是单个账户,这些信号都不可见。
为什么逐账户审查会失败
大多数滥用工具都围绕着逐账户裁决构建。一个账户注册,获得评分,获得风险等级,然后得到一个决定。这种模式对于它设计的滥用行为——例如欺诈者使用被盗卡片,或垃圾邮件发送者轰炸某个渠道——效果很好。
它之所以在蒸馏面前失败,是因为一个特定的结构性原因:攻击者控制着单个账户在活动中承担的份额。
如果你的审查阈值是“一个账户发出50,000个异常请求”,那么攻击者会使用20,000个账户,每个账户发出800个请求。如果你的阈值降低,他们就增加账户。经济学上他们占优势,因为账户是系统中成本最低的投入。前沿模型API调用有实际的边际成本;电子邮件地址没有。
因此,攻击者的优化问题很简单:将每个账户的行为保持在任何逐账户阈值之下,并进行横向扩展。这之所以有效,是因为防御措施衡量的是错误的对象。它衡量的是账户,而对手是行为者。
这就是九头蛇特性。砍掉一个账户,就会出现两个,因为生成账户的东西从未被触及。Anthropic报告中提到的一个代理网络同时运行20,000多个账户,正是这种特性的纯粹体现——在这种规模下,逐一删除账户不是防御,而是一项维护任务。
要击败九头蛇,你必须停止砍头,开始寻找它的身体。
蒸馏防御的三层
一个严肃的防御有三层,它们由不同的实体负责。
| 层 | 所有者 | 角色 |
|---|---|---|
| 模型控制 | 模型提供商 | 限制敏感推理痕迹,塑造输出,保护模型行为 |
| 流量检测 | 模型提供商,或研究/供应商堆栈 | 检测重复的、语义集中的或协调的提取模式 |
| 验证访问 | 身份基础设施 | 解析账户背后的真实身份,关联共享标识符,对所有与已确认滥用者相关联的事物强制执行策略 |
前两层已广为人知并积极研究。在流量方面,最近的学术工作确实令人鼓舞:Liu、Guo和Dong(arXiv 2606.05725,2026年6月)将提取监控构建为良性校准的流量窗口分布测试,使用仅在良性流量上校准的语义空间中的最大均值差异。在来自四种提取场景的十四个攻击者-正常查询对中,他们报告称,在良性查询上0.3%的误报率下,纯攻击者情况的检测率达到100%。
这是一个强有力的结果,并且值得明确其含义:流量检测有效,而这不是Didit所讨论的层面。提示词分布的语义分析是模型提供商的工作,也应该由他们来做。
第三层是发布设计指南最少的一层——包括在该行业关于威胁的权威简报中。
权威简报涵盖了什么
前沿模型论坛在Anthropic报告发布的同一天,发布了其对抗性蒸馏议题简报。这是一份很好的文件。它将对抗性蒸馏定义为秘密访问模型输出(通常违反服务条款)以训练一个次级模型,该模型复制了教师模型的能力,同时绕过了其安全训练。它列举了各种方法:思维链提取、思维链批判、思维链自动评分、用于强化学习的提示生成以及合成数据生成。它指出了目标能力:数学和科学推理、代理编码、多模态处理、通用推理。
它还承认了这一领域真正的矛盾——“在不阻碍合法研究的情况下解决这些安全问题。”
它不包含任何关于账户验证、身份解析、速率限制或访问控制的建议。
这是一个范围选择,也是一个明智的选择:该简报旨在定义威胁及其方法,而不是规定控制措施。访问层设计仅仅是另一份文档。
然而,这份文档行业尚未真正编写——尽管衡量威胁的实验室在其投资的缓解措施中,将“加强教育和初创账户的验证”与检测分类器和行为指纹识别并列。访问层在实践中发挥着实际作用,但其背后公开发布的设计指南却很少。这就是本文其余部分要讨论的内容。
验证访问层实际做了什么
在这里,我们需要精确地阐述主张,因为夸大其词会使整个类别失去可信度。
身份验证无法检测蒸馏。它无法查看提示词语义,不知道目标能力是什么,也永远无法告诉你请求流看起来像思维链提取。那是流量层的工作。
身份验证所做的是以四种特定方式改变攻击者的成本结构。
它降低了匿名性。绑定到经过验证的个人或注册公司的账户,是具有可归属所有者的账户。这并不能阻止滥用,但它改变了滥用的成本和风险。
它将共享物理事物的账户关联起来。由同一张脸、同一设备或同一网络注册的两个账户是相关的,无论它们的行为看起来是否相关。这是逐账户审查无法产生的信号,它正是Anthropic所描述的那些浮出水面的活动所具有的信号类别——共享支付方式、共享时间、共享基础设施。
它使再生变得昂贵。九头蛇特性取决于新账户的廉价性以及与旧账户的断开。当一个已确认的滥用案例传播到它所触及的每一个标识符——面部、设备、IP范围、电子邮件、电话——从相同基础设施创建的下一个账户就会在门口失败,而不是在800个请求之后才被捕获。
它避免给合法开发者带来摩擦。这是使整个方案可行的约束。对所有人应用验证是一种增长税。自适应地应用验证——根据访问层级、配额、信用额度、地理位置或来自流量层的行为警报——将摩擦施加给风险,并使受信任的开发者路径保持快速。
四件事。没有一件是“阻止提取”。所有四件都是真实的。
Didit的定位
Didit是身份和欺诈的基础设施,构成验证访问层的基本功能是我们已经提供并公布价格的:
- 身份验证 — 身份证件、被动活体检测、人脸匹配和IP分析,捆绑价格为每次验证0.33美元,每月提供500次免费KYC验证。
- 人脸搜索1:N — 在您的应用程序已注册的已验证用户中进行生物识别搜索,验证后免费。这是将两个账户关联到同一个人的基本功能。
- IP和设备分析 — 0.03美元,并包含在0.33美元的捆绑包中。会发出
DUPLICATED_IP_ADDRESS、DUPLICATED_DEVICE_FINGERPRINT、DEVICE_RECOVERED_HIGH_CONFIDENCE、AUTOMATION_FRAMEWORK_DETECTED及相关代码。 - 列表API — 跨12种入口类型的黑名单,其中一个已确认会话的黑名单会自动提取该会话捕获的标识符——面部、文档、电话、电子邮件、IP和设备。
- 生物识别认证 — 0.10美元的无密码重新验证,用于将特权操作绑定到入职时的人员而非持有者令牌。
- 企业验证 — 每家公司2.00美元起:注册查询、最终受益人及高管,实体筛选费用为0.20美元,任何关联的受益人身份检查均按标准用户验证费率计费。适用于组织级和研究级访问。
您可以将这些功能组合成您的平台所需的任何策略。组合是您的架构;基本功能是组成部分。每个功能都通过统一的/v3/ API 提供,并公布了价格且无最低消费——有些作为独立的端点,如POST /v3/face-search/,有些通过会话工作流提供,如生物识别认证,它没有独立的端点。
使用案例
前沿模型提供商。将高配额、高信用额度和研究级访问权限绑定到经过验证的个人或公司,同时保持免费和低量级访问的无摩擦。
AI API平台和推理提供商。经销商和聚合商会继承滥用行为,但不会继承检测堆栈。访问层通常是他们实际拥有的唯一控制措施。
AI编码和代理产品。试用滥用和信用套现使用与蒸馏相同的账户倍增机制。相同的关联原语可以解决这两种问题。
云AI平台和市场。组织级验证在授予企业配额之前回答“这是一家拥有真实受益人的真实公司吗?”
常见问题
身份验证能阻止模型蒸馏吗?
不能。提取(在一定程度上)通过模型级别的输出控制和语义流量检测来阻止。身份验证降低匿名性,将活动中的账户关联起来,并使重新生成的账户尽早失败。它是三层之一。
验证不会赶走合法的开发者吗?
只有当你对所有人应用验证时才会。有效的设计是自适应的:根据风险、层级、配额、信用额度、地理位置或行为警报进行验证。大多数开发者不应该看到验证步骤。Didit的可复用KYC是免费的,因此已在网络上其他地方验证过的开发者可以无需重复检查即可通过验证。
Didit能告诉我请求流看起来像蒸馏吗?
不能。Didit不查看您的提示词,也不分析请求语义。该信号来自您自己的流量层。Didit提供的是将该警报附加到行为者的身份解析,以及对与该行为者相关联的所有账户采取行动的执行原语。
在AI平台规模下,这要花多少钱?
验证按成功检查次数计费,无最低消费:完整的身份验证捆绑包为0.33美元,单独的IP和设备分析为0.03美元,人脸搜索1:N免费,生物识别重新认证为0.10美元,企业验证2.00美元起。由于策略是自适应的,您只需支付实际需要检查的那部分访问费用。每月前500次KYC验证免费。
我们已经有欺诈供应商了。这有什么不同?
大多数欺诈工具返回的是逐账户裁决。蒸馏问题是逐行为者问题,而将账户关联到同一行为者的基本功能——对您自己的用户进行1:N生物识别搜索、设备和IP关联,以及从单个已确认案例中将黑名单传播到所有标识符——正是逐账户评分所不具备的特定功能。
准备好开始了吗?
从今天能产生您所缺少关联信号的基本功能开始。