跳到主要内容
Didit 融资 750 万美元,打造身份与欺诈基础设施
Didit
返回博客
博客 · 2026年8月4日

防御模型提取的访问层策略 (ZH)

这份整合的策略包括:三层防御各自的职责,构建访问层的四个基本要素,触发和执行的设计,成本模型,以及身份验证能力的实际限制。.

作者:Didit更新于
ai-model-extraction-defense-playbook.png

本专栏的所有内容都将整合为一个架构。这就是该架构的紧凑表述——每一层负责什么,哪些基本要素构建了访问层,触发器和执行如何协同工作,成本是多少,以及它何时失效。

如果您要阅读本系列中的一篇帖子,请阅读这篇。如果您打算构建这个系统,也请阅读其他帖子。

关键要点

  • 三层:模型控制流量检测验证访问。您拥有前两层。第三层可由已发布、明码标价的基本要素组合而成。
  • 四个访问层基本要素:收集(设备和网络)、关联(生物识别1:N)、绑定(身份和企业验证)、执行(黑名单传播)。
  • 最便宜的层承担了大部分工作。在每个付费账户上以0.03美元收集数据——没有它,后续的每一次调查都将无法进行。
  • 触发器应在访问转换和行为警报时触发,而不是基于计时器。
  • 一个拥有100,000名开发者的平台,其现实成本约为每月800-1,200美元,每月享有500次免费的KYC验证。
  • 身份验证并不能阻止模型提取。它提高了成本,降低了匿名性,并缩短了重新生成账户的生命周期。任何声称更多功能的人都是在夸大其词。

第一层:您已拥有的部分

在添加任何内容之前,请明确您自己拥有且将继续拥有的两层。

模型控制——限制敏感推理轨迹,塑造输出,限制响应揭示其生成方式的信息。前沿模型论坛的议题简报列出了攻击者在此处的目标:思维链条外泄,思维链条批判,思维链条自动评分,用于强化学习的提示生成,以及合成数据生成。每一个都针对模型输出的内容。只有模型提供商才能改变这一点。

流量检测——发现重复的、语义集中的或协调的请求模式。这一层正在迅速发展。Liu、Guo和Dong(arXiv 2606.05725)将提取监控视为使用语义空间中最大均值差异的良性校准流量窗口分布测试,并报告在十四个攻击者-正常查询对上,纯攻击者情况的检测率为100%,误报率为0.3%。

这两者都不是身份问题,也没有任何身份供应商应该试图向您推销它们。身份基础设施所做的是回答这些层提出但无法解决的问题:这个账户行为异常——有多少其他账户属于同一个行为者,我该如何处理所有这些账户?

四个基本要素

1. 收集 — 0.03美元,适用于每个付费账户

对您最便宜的付费层级上的每个账户进行IP和设备分析。不是为了做任何决定。只是为了获取数据。

您购买的代码是DUPLICATED_DEVICE_FINGERPRINT(重复设备指纹)、DUPLICATED_IP_ADDRESS(重复IP地址)、DEVICE_RECOVERED_HIGH_CONFIDENCE(设备高置信度恢复)、AUTOMATION_FRAMEWORK_DETECTED(检测到自动化框架)、DEVICE_EMULATOR_DETECTED(检测到设备模拟器)、DEVICE_ROOTED_OR_JAILBROKEN(设备已root或越狱)、DEVICE_RUNTIME_HOOKING_DETECTED(检测到设备运行时挂钩)、DEVICE_APP_TAMPERED(设备应用被篡改)以及网络家族。

这是策略中杠杆率最高的决定,也最常被跳过,因为在第一天它看起来似乎毫无作用。它是关联的基础。当您的流量层在第九个月标记一个账户时,一个账户封禁和三十个账户集群之间的区别完全在于您在第一个月是否进行了收集。您无法追溯补救。会话已经消失。

2. 关联 — 免费

人脸搜索1:N在您的应用程序执行的所有已批准验证中搜索人脸,返回每个匹配项并附加您自己的vendor_data。使用Didit验证免费,亚秒级响应,并在验证会话中的活体检测期间自动运行。

这是将账户转化为行为者的基本要素。两万个账户是一个庞大的数字。两万张人脸则不是操作员所能拥有的。

3. 绑定 — 个人0.33美元,组织2.00美元起

在具有真实风险的访问转换(如配额增加、信用授予、密钥发放、能力层级升级)时进行全面身份验证。ID证件、被动活体检测、人脸匹配和IP分析,费用为0.33美元,每月前500次免费。

对于组织、研究和教育层级——Anthropic专门在“加强教育和初创账户验证”中提及的类别——企业验证从2.00美元起,解决注册状态、实益拥有人及高级职员,并可在同一会话中为每个实益拥有人提供关联身份验证。

生物识别重新认证费用为0.10美元,适用于账户很久以前已验证,现在的问题是是否仍由同一个人操作的情况。

4. 执行 — 已包含

当案例确认后,使用reference_session_id进行黑名单处理,Didit会自动从该会话中提取正确的标识符——人脸、证件、电话、电子邮件、IP或设备——涵盖12种条目类型,并将条目链接回其来源会话。条目在验证时立即生效。当证据指向基础设施时,ip_address接受CIDR范围。

在相同的12种类型上设置白名单,可确保设计合作伙伴和企业工程团队免于卷入任何升级路径,这也是严格政策得以维系的关键。

触发器设计

没有触发器的基本要素就是成本中心。以下规则适用:

在访问转换时触发。配额增加、信用授予、新API密钥、层级升级、新的特权团队成员、账单所有者变更。

在您自己的行为警报时触发。这是设计中价值最高的触发器,也是各层之间的集成点。您的语义检测产生身份基础设施无法提供的信号;身份则提供语义分类器无法提供的解决方案和执行。两者都不能替代对方。

在链接信号时触发。新账户上的DEVICE_RECOVERED_HIGH_CONFIDENCE,或与现有已验证用户匹配的人脸,无论请求内容如何,都应获得升级验证。

不要基于计时器触发。定期重新验证所有用户会按用户基础的比例产生成本,但保护效果却与任何比例都无关。

不要在注册时触发。让用户注册、阅读文档、获取密钥并进行实际调用。注册时验证的转化率最差,保护效果最低。

成本模型

以一个拥有100,000名注册开发者的平台为例,其分布如下:

层级账户数检查项单价月费用
免费85,000$0$0
付费自助服务12,000IP + 设备$0.03$360 一次性,之后仅限新账户
高配额 / 信用2,500完整包$0.33$825 一次性,之后仅限新账户
组织 / 研究500企业验证$2.00起$1,000 一次性,之后仅限新账户
警报升级约200 / 月生物识别认证$0.10$20

一次性费用很重要:验证是按账户进行的,而不是按月。稳定状态的成本由进入每个层级的账户加上警报驱动的升级决定——对于大多数平台,在这种规模下,每月大约800到1,200美元。每月前500次KYC验证免费,之后按成功次数付费,没有最低消费或席位许可证。

对照Anthropic测量的活动——超过1600万次交换通过大约24,000个欺诈账户。1600万次交换的推理成本不是几百美元的数字。

您的分布可能与表格有所不同。但结构性结论不变:昂贵的检查适用于最少的账户,而适用于最多账户的检查是免费的。

实施顺序

  1. 首先收集。对每个付费账户进行IP和设备分析。在做其他任何事情之前先做这个,因为它是唯一一个等待时间越长就越难进行的步骤。
  2. 仅作检测,不强制执行。运行一个月,看看代码实际上对您的人群说了什么。每个平台的基线都不同,针对假定基线强制执行会产生误报。
  3. 连接警报路径。将您的流量层警报连接到验证触发器。这是使两层更具价值的集成。
  4. 在顶层添加绑定。对高配额和信用升级进行全面验证;对组织和研究层级进行企业验证。
  5. 构建执行操作手册。首先解决集群问题,然后从已确认的会话中跨所有条目类型列入黑名单,然后验证执行是否成功。在解决问题之前强制执行只会封禁一个账户并警告操作员。
  6. 将您的朋友列入白名单。在收紧任何政策之前,明确地将设计合作伙伴和企业工程团队排除在外。

此方法何时失效

一份诚实的策略会说明其自身的局限性。

它不检测提取。身份基础设施从不查看您的提示。如果您的流量层较弱,访问层将无法弥补——它将忠实地解析您从未标记过的行为者。

一个有决心、资金充足的操作员仍然可以进入。付钱给真实的人,使用真实的证件,在真实的设备上开设账户,这会击败所有身份控制,因为这些账户确实是独立的。这改变的是价格。原来几乎免费的账户农场现在需要招募、协调和每人的开销——而且由此产生的网络更小,重新生成的速度也更慢。

每一层都会产生误报。共享办公室会产生DUPLICATED_IP_ADDRESS。家庭共享设备。开发者合法拥有两个账户。这就是为什么重复信号默认是信息性的,以及为什么政策由您来设定。

验证确实会带来摩擦,并对您的转化漏斗造成实际成本。分层设计的目的是让不应该遇到这些摩擦的人避免它们,但影响并非为零。请衡量它。

这是一个成本函数,而不是一堵墙。成功不是“提取变得不可能”。成功是,一个需要20,000个账户的活动现在需要20,000个经过验证的身份,每次移除的成本都比一个电子邮件地址的替换成本更高,并且一个已确认的案例会传播到所有受影响的环节。

常见问题

首先要做的最具杠杆作用的事情是什么?

在每个付费账户上以0.03美元收集设备和网络信号。第一天它看起来似乎毫无作用,但它是后续所有调查得以进行的原因。它无法追溯补救。

我们需要所有四个基本要素吗?

不。收集和关联能为您提供大部分分析价值。绑定和执行则让您能够对其采取行动。从收集开始。

这与我们已运行的检测分类器如何协同作用?

它们是互补的。您的分类器会说此账户正在做一些错误的事情。人脸、设备和网络关联会说这是三十个账户,而不是一个。黑名单传播会使响应覆盖所有这些账户。两层都不能替代对方的工作。

Didit是否部署在尖端AI公司?

我们不讨论谁使用Didit。这里描述的一切都基于有文档记录、公开定价的基本要素,任何团队都可以根据自己的架构进行评估,每月从500次免费KYC验证开始。

验证AI代理而不是人类呢?

代理身份是一个真实且尚未解决的问题,Didit的MCP服务器已上线且免费。但迄今为止测量的提取活动都是大规模地在人类注册账户上进行的,这正是本策略所解决的问题。

这些能完全阻止模型蒸馏吗?

不能。模型级别的输出控制和语义流量检测仍然是必要的,并且由模型提供商负责。访问层降低了匿名性,解析了跨账户的行为者,提高了重新生成账户的成本,并为您现有的警报提供了行动依据。这就是我们的主张,并且仅此而已。

准备好开始了吗?

在承诺使用任何一个基本要素之前,先用可定价的基本要素构建访问层。

身份与欺诈基础设施。

一个 API 即可实现 KYC、KYB、交易监控和钱包筛选。5 分钟即可集成。

让 AI 总结此页面
防御模型提取的访问层策略 | Didit.