深度伪造:类型、检测与防御策略 (ZH)
一份关于深度伪造图像、视频和音频的实用指南:它们是如何制作的,身份攻击如何利用它们,分层检测的工作原理,以及如何评估防御措施。.

深度伪造(Deepfake)是利用机器学习技术创建的合成或篡改媒体,旨在使某人看起来在说、做或呈现一些未曾发生过的事情。深度伪造可以改变或生成图像、视频和音频;在身份攻击中,它们可以冒充真实人物、创建合成身份、修改身份证据,或将伪造媒体注入远程验证流程。
深度伪造防御并非单一检测器。可靠的决策结合了媒体溯源、法证分析、可信捕获、演示攻击检测、身份关联、设备和网络信号、交易上下文以及针对不确定情况的升级流程。
主要收获
- 深度伪造是一种媒体类别,而非单一攻击。换脸、重演、唇音同步、声音克隆、完全生成的人物和篡改文件会产生不同的证据和风险。
- 演示攻击和注入攻击不同。演示攻击是将伪造物展示给真实传感器;注入攻击是在传感器之后或代替传感器插入伪造媒体。
- 人工目视检查不足以作为控制措施。压缩和新的生成器会消除熟悉的伪影,而真实媒体有时也可能看起来异常。
- 检测分数是条件性的。结果取决于测试中使用的生成器、攻击、捕获路径、压缩、人群、阈值和操作环境。
- 验证比单独的外观更可靠。高风险请求应绑定到身份、设备、经过身份验证的通道和独立的批准流程。
什么是深度伪造?
这个词结合了“深度学习”和“伪造”。它最初描述的是换脸视频,但现在普遍用法包括逼真的人工智能生成或人工智能操纵的图像、视频和语音。关键问题不在于每个像素是否都是生成的,而在于计算操纵是否产生了关于身份、言语、行为或来源的误导性证据。
深度伪造属于更广泛的合成媒体范畴。合成媒体在电影、无障碍、教育、本地化、隐私和创意作品中也有合法用途。当媒体被用来提出虚假主张时——特别是关于谁在场、谁授权了某项行动或媒体来源何处的主张时,安全风险就会出现。
深度伪造、廉价伪造和合成身份
- 深度伪造:利用机器学习方法生成或操纵的媒体,旨在模仿或伪造人物、物体或事件。
- 廉价伪造:通过简单编辑、重新标记、速度改变、选择性裁剪或在其原始上下文之外重复使用而产生的误导性媒体。
- 合成身份:由虚构和真实属性组合而成的身份。它可能使用深度伪造媒体,但攻击目标是身份记录——而不仅仅是媒体。
- 人脸融合:由两个人或更多人混合而成的一张肖像,通常是为了使结果与多个身份相似。
- 重放:向捕获系统播放真实或被操纵的媒体。内容可能是真实的,但现场存在的主张是虚假的。
这些类别可能会重叠。欺诈者可能在一次尝试中结合被盗文件、融合肖像、实时换脸、住宅代理和被入侵的账户。
存在哪些类型的深度伪造?
| 类型 | 变化内容 | 典型身份风险 | 有用的控制层 |
|---|---|---|---|
| 换脸 | 一张脸被映射到另一个人身上 | 入职、通话或账户恢复中的冒充 | 可信捕获、活体检测、人脸比对、注入检查 |
| 面部重演 | 表情、姿势或凝视由另一个来源驱动 | 传递提示或模仿实时行为 | 不可预测的线索、时间分析、传感器完整性 |
| 唇音同步 | 嘴部动作被改变以匹配新的音频 | 伪造声明或通话冒充 | 音视频一致性、溯源、独立确认 |
| 声音克隆 | 语音以目标声音合成 | 支付或凭证重置社会工程 | 回拨、强认证、双重批准、音频分析 |
| 完全生成人物 | 图像或视频描绘了一个不存在的人物 | 合成账户、虚假档案、洗钱者招募 | 身份证据、数据库检查、设备和网络分析 |
| 文件篡改 | 肖像、文本、布局或安全特征被修改 | 虚假身份证据 | 文件验证、实时文件捕获、NFC或发行方检查 |
| 人脸融合 | 多张脸融合为一张肖像 | 一份文件可能与多个人匹配 | 融合检测、发行方质量参考、人工审查 |
没有哪一行有完美的单一控制。人脸检测器无法确定文件真实性。内容溯源无法证明签名者的真实身份。传感器上的活体检测不能自动检测下游注入的媒体。
深度伪造是如何创建的?
现代深度伪造可以通过多种模型家族生成。技术细节各不相同,但实际工作流程通常包括源材料收集、表征学习、生成、合成和后处理。
1. 收集源材料
攻击者收集目标人物的图像、视频或语音录音。公开采访、社交资料、视频会议、泄露文件和之前的验证捕获都可以成为源材料。对于完全生成的身份,模型会创建一个新的主题,而不是复制一个人。
2. 模型学习或保留身份特征
换脸系统编码面部结构和外观,然后将目标身份呈现在源表演者之上。重演系统转移姿势或表情。语音系统学习说话者特征,并从文本或另一个声音生成语音。
3. 生成合成内容
生成对抗网络、自编码器、扩散模型和神经渲染系统都可以做出贡献。仅凭模型家族并不能告诉防御者会留下哪些伪影;不同的训练数据和后处理会产生不同的痕迹。
4. 结果合成和校正
混合、色彩校正、重新打光、音频清理、帧插值和唇音同步使输出更加连贯。欺诈者可以故意添加模糊或压缩以隐藏生成器痕迹。
5. 媒体交付
交付方式决定了攻击面。文件可以上传、在屏幕上显示、打印、在视频通话中播放、通过虚拟摄像头路由或在捕获组件和服务器之间注入。
最后一步正是为什么纯粹的法证定义对于身份系统来说是不够的。同样的生成人脸在公开张贴、向摄像头显示或注入验证SDK时会产生不同的威胁。
深度伪造如何用于身份攻击?
演示攻击
攻击者将照片、屏幕、打印面具、重放或其他伪造物呈现给合法的摄像头或生物识别传感器。ISO/IEC 30107将此捕获边界处的控制称为演示攻击检测(PAD)。活体检测是PAD的一个子集。
注入攻击
攻击者绕过或干扰预期的捕获,并将伪造媒体注入处理路径。例子包括虚拟摄像头、模拟器、钩子、修改后的SDK、被操纵的网络请求或服务器端文件替换。
NIST SP 800-63A-4将注入预防和伪造媒体检测视为不同的要求。它指出单独的生物识别比对并不能阻止注入媒体,并建议采取控制措施以增加对捕获传感器和受保护通道的信任。
冒充和社会工程
语音或视频克隆可以使紧急请求看起来来自高管、员工、客户、供应商或家庭成员。目标可能是支付、凭证重置、信息披露或政策例外。在这种情况下,最好的防御可能是遵守流程——例如已知的回拨路径或双重批准——而不是试图实时判断像素。
OWASP深度伪造响应指南强调了持久的安全流程、财务控制、验证程序、意识和事件响应,而不是狭隘地关注发现视觉缺陷。
合成账户创建
生成的肖像、伪造的属性、篡改的证据、一次性联系方式和混淆的网络连接可以组合起来创建不对应于一个真实人物的账户。媒体只是更广泛的身份和行为图中的一个信号。
账户恢复和重新绑定
如果恢复流程依赖于自拍照或视频通话,合成媒体可能被用来接管现有账户或绑定新的认证器。恢复通常需要比常规登录更强的保障,因为它可能会取代通常保护账户的控制措施。
深度伪造检测如何工作?
深度伪造检测询问媒体是否被生成或操纵。身份验证询问一个人是否是他们声称的身份。这些问题有重叠,但彼此都不能完全包含对方。
溯源和内容凭证
溯源记录了媒体如何创建和更改的信息。C2PA内容凭证规范定义了一个防篡改结构,可以将来源和编辑声明绑定到资产。
有效的溯源可以增加对媒体历史和签名者的信任。溯源缺失并非篡改的证据,有效的溯源也不能保证所描绘的主张是真实的。溯源是一个积极的信号,而不是一个通用的检测器。
空间法证分析
图像模型可以检查纹理、混合边界、光照、反射、频率模式、噪声、几何形状和生成器伪影。这些特征可能在已知攻击家族上表现良好,但在模型、摄像头或压缩发生变化时会退化。
时间与音视频分析
视频分析可以检查帧间一致性、运动、姿态、光流、面部特征点、语音时序和音视频对齐。语音分析可以检查频谱、韵律和生成痕迹。实时使用增加了严格的延迟和质量限制。
演示攻击检测和活体检测
PAD寻找欺骗捕获传感器的尝试。被动活体检测可以在不要求用户执行明确动作的情况下分析捕获。主动活体检测要求对提示或挑战做出响应。
PAD的范围限于捕获边界。ISO/IEC 30107-3明确将生物识别捕获设备之外的攻击视为超出范围。声称PAD覆盖范围的供应商应单独解释注入、虚拟摄像头、模拟器和通道控制。
捕获完整性与设备认证
捕获控制试图确定媒体来自预期的传感器、应用程序、设备状态和受保护通道。信号可以包括SDK完整性、设备认证、模拟器或虚拟摄像头检测、签名捕获事件、防篡改措施和服务器端重放保护。
没有设备信号是万无一失的。目标是使伪造交付更难、可检测且成本高昂,同时为异常设备上的真实用户保留恢复路径。
身份与证据关联
人脸比对可以将实时捕获与可信肖像关联起来;文件验证可以测试证据本身;数据库验证可以证实属性。这些控制措施不能分类所有合成媒体,但它们降低了缺乏可靠身份锚点的令人信服的人脸的价值。
情境与行为风险
设备重用、IP和位置不一致、不可能的旅行、重复尝试、速度、账户历史、交易上下文和关系图可以揭示媒体分析遗漏的模式。深度伪造分数应有助于风险决策,而不是抹去其他证据。
人工审查与独立验证
审查员需要原始媒体、检测器输出、原因代码、捕获详细信息、客户历史记录和明确的操作手册。对于高影响力的操作,独立的可信通道——例如回拨到已知号码或在经过身份验证的系统中批准——可能比视觉判断更可靠。
深度伪造检测器可能出错的地方?
误报(False Negative)
检测器将操纵媒体分类为真实。这是导致攻击通过的安全失败。
误判(False Positive)
检测器将真实媒体分类为操纵。这可能会阻止真实客户、触发不必要的审查,或不成比例地影响某些设备和人群。
领域偏移
生产环境与测试集不同:新的生成器、摄像头管道、编解码器、光照、语言、人口统计或攻击行为。NIST的GenAI深度伪造评估计划正是因为学术基准性能可能无法干净地转移到部署,而专注于对抗性和操作相关的测试。
阈值不匹配
每个分数只有在应用阈值后才能成为决策。为法证分类调整的阈值可能不适用于即时开户。安全性、用户摩擦、人工审查能力和下游损失都会影响操作点。
范围混淆
在上传人脸图像上评估的检测器可能对音频克隆、实时虚拟摄像头、文件融合或重放一无所知。产品标签应替换为按攻击类型的覆盖矩阵。
团队应如何评估深度伪造防御?
首先定义威胁模型
列出受保护的操作、攻击者能力、媒体类型、交付路径、预期设备、可用身份锚点和错误后果。“检测深度伪造”不是一个可测试的需求。
要求攻击覆盖矩阵
询问测试是否包括换脸、重演、唇音同步、完全生成人脸、声音克隆、融合、打印和屏幕重放、虚拟摄像头、模拟器、SDK篡改和API注入。记录哪个控制措施负责每种攻击。
检查测试数据
寻找未见过的生成器、多种攻击工具、真实用户、人口统计覆盖、不同摄像头、压缩、网络退化和生产环境般的捕获。分离开发、验证和测试集。询问评估更新的频率。
审查两种错误率
获取操作阈值下的误报和漏报行为,而不仅仅是准确率标题。要求置信区间、样本计数、每次攻击结果、子组分析和无响应率。
测试整个流程
评估捕获SDK、传输、后端、决策引擎、Webhook、重试行为、人工审查和账户状态。即使强大的媒体分类器也可能位于可重放请求或不安全的恢复流程之后。
运行影子部署
在阻止客户之前,以影子模式对生产流量进行评分。将检测器结果与审查员发现、已确认的欺诈、用户重试、支持案例和下游损失进行比较。然后设置分级操作,例如允许、升级、审查、限速或拒绝。
规划漂移
定义新攻击摄取、红队演练、模型更新、阈值审查、事件响应和回滚的所有权。一次性供应商测试无法覆盖不断变化的生成器生态系统。
常见的深度伪造防御错误
训练用户寻找视觉故障
眨眼、手、牙齿、唇音同步和边缘伪影可能是线索,但它们既非必要也非充分。普通视频在压缩后可能看起来很奇怪,新的生成器可以消除过去的特征。
购买一个“深度伪造分数”
一个分数很少能覆盖所有媒体和交付路径。要求提供关于模型范围、攻击覆盖、测试条件、阈值和错误权衡的证据。
假设活体检测能阻止注入
活体检测可以在传感器边界提供帮助。注入攻击针对该边界周围或之后的路径,因此也需要捕获完整性和通道控制。
将缺失的溯源视为欺诈证据
许多真实资产没有内容凭证。缺失意味着溯源信号不可用,而不是媒体是假的。
自动拒绝所有不确定的结果
模糊情况需要基于风险的升级或审查。检测器的不确定性不应成为无法解释的永久拒绝。
忽略非媒体控制措施
支付批准、账户恢复、凭证更改和数据披露应具有即使完美模仿也能幸存的控制措施。强认证、职责分离、可信回拨、限制和延迟可以减少影响,即使检测失败。
分层防御模型
| 层级 | 问题 | 示例结果 |
|---|---|---|
| 溯源 | 此资产是否有有效、可信的历史记录? | 已验证凭证、缺失凭证、无效绑定 |
| 媒体法证 | 媒体是否显示出篡改或生成的证据? | 带有攻击家族证据的风险评分 |
| 捕获完整性 | 媒体是否来自预期的传感器和应用程序? | 已认证捕获、虚拟摄像头、重放、未知 |
| PAD和活体检测 | 传感器前是否存在真实人员? | 真实、演示攻击、重试 |
| 身份关联 | 此人是否与可信身份证据匹配? | 匹配、不匹配、质量不足 |
| 情境 | 设备、网络、账户和行为是否一致? | 正常、不一致、高速度、关联滥用 |
| 流程 | 请求的操作是否经过独立授权? | 允许、升级、双重批准、暂停 |
这些层级应产生可解释的证据和有界限的操作。高风险结果可以触发更强的捕获、不同的因素、人工审查或独立确认,而不是立即不可逆转的结果。
Didit的优势
Didit提供被动活体检测,价格为0.10美元,以及主动活体检测,价格为0.15美元,其认证包括iBeta Level 1 PAD。这些演示控制可以与身份验证、活体检测、人脸比对和设备与IP分析结合使用,形成基于风险的工作流程。
每个控制都有其边界。团队应将PAD结果映射到演示攻击,单独评估捕获和注入保护,并保留自己的决策和审查逻辑。公布的模块费率可在定价页面查阅。
常见问题
所有AI生成的图像都是深度伪造吗?
不一定。“深度伪造”通常暗示合成或操纵的媒体,旨在伪造身份、言语、行为或事件。一个明确标记为生成的插图是合成媒体,但不一定具有欺骗性。
人们能可靠地通过肉眼识别深度伪造吗?
不能。视觉线索可以支持分类,但可靠性会随着生成器、媒体质量、压缩和观看者而变化。高影响力的决策需要技术和程序验证。
演示攻击和注入攻击有什么区别?
演示攻击是将假冒物放置在预期传感器前。注入攻击是将伪造媒体插入处理路径,绕过或干扰预期的捕获。
活体检测能阻止所有深度伪造吗?
不能。活体检测是一种以捕获为重点的控制措施。其覆盖范围取决于方法和测试,它不自动覆盖音频、文件、内容溯源或下游注入。
内容凭证是媒体真实的证据吗?
当签名者和绑定可信时,它们可以提供关于来源和编辑的防篡改溯源。它们不判断所描绘的主张是否真实。
深度伪造检测器的哪些指标是重要的?
部署阈值下的误报和漏报行为,按攻击类型、生成器、捕获条件、设备和相关人群细分。团队还应测量无响应率、延迟、审查负荷和下游欺诈。
当检测器不确定时应该怎么做?
采用分级响应:请求新的可信捕获、要求另一个认证器、通过独立通道验证、暂停操作或将案件路由给受过培训的审查员。
主要参考资料
- NIST SP 800-63A-4:身份证明和注册
- NIST GenAI:深度伪造2026评估计划
- ISO/IEC 30107-3:2023 PAD测试和报告
- C2PA内容凭证解释器
- OWASP深度伪造事件准备和响应指南
- ENISA远程身份证明攻击和对策
深度伪造的弹性来自于提出几个更具体的问题,而不是相信一个宽泛的分数。验证媒体历史、捕获路径、活体人员、身份证据、周围环境和授权过程——然后根据风险做出决定。