跳到主要内容
Didit 融资 750 万美元,打造身份与欺诈基础设施
Didit
返回博客
博客 · 2026年9月7日

文档AI:从任何文档中提取您定义的字段 (ZH)

工资单、资金证明、报税表、公司注册契约、银行对账单。入职流程中最重要的文件往往没有固定模板。文档AI能从这些文件中读取您定义的字段,并进行交叉核对。.

作者:Didit更新于
document-ai-custom-document-data-extraction.png

身份证明文件很容易处理。全球大约有14,000种身份证明文件,它们都有固定的布局,一个优秀的OCR引擎无需任何指示就能读取它们。但真正阻碍入职流程的是其他文件:墨西哥的税务登记证(constancia de situación fiscal)、委内瑞拉的RIF、西班牙的公司章程(escritura de constitución)、印度的银行对账单、英国的工资单,以及某位会计师出具的财富来源信。这些文件没有两份是相同的,也没有任何模板可以涵盖它们。

通常的解决方案是人工处理。有人打开PDF,读取数字,输入到表格中,然后继续下一个——每周重复几百次。文档AI就是非人工的解决方案。

主要功能

  • 您可以为每个工作流配置最多三个文档,并为每个文档定义您希望提取的精确字段——名称、类型(textnumberdate)、提取指令,以及是否为必填项。
  • 视觉语言模型会根据您定义的字段构建的模式来读取每个文档,并返回类型化值——数字以数字形式返回,日期以YYYY-MM-DD格式返回。
  • 每次上传都会进行PDF和EXIF取证,以检测篡改。
  • 提取的字段可以与其他步骤进行交叉引用——例如,银行对账单上的账户持有人姓名可以与已验证身份上的姓名进行交叉核对,也可以与您编写的自定义规则进行核对。
  • 每个文档0.20美元。如果文件已在您手中,并且您不需要任何托管UI,我们还提供独立的API。

文档AI的功能

您只需描述一次文档。您为其提供屏幕标题和描述(会自动翻译成所有验证语言),并列出要读取的数据点。每个字段都有一个键、一个易懂的名称、一个告诉模型查找内容的指令、一个类型以及一个必填标志。

用户上传PDF或图像。Didit会渲染它,根据您的模式运行提取,进行取证,然后应用您的规则。结果是每个文档的状态,最终汇总到功能状态中,其中Declined优先于In ReviewIn Review优先于Approved

为何重要

有三件事是固定模板OCR无法解决的,它们会在入职流程中造成障碍。

文档没有模板。资金证明是客户银行选择打印的任何内容。财富来源信是散文。唯一能泛化的模型是根据意义而非位置进行读取的模型。

数据必须与会话的其余部分保持一致。单独从工资单中提取“J. Smith”价值很小。提取它并将其与已验证身份文件上的全名进行比较才是一种控制。文档AI进行比较,并让您决定失败时发生什么。

文档可能被编辑过。将不同的数字粘贴到原始工资单上是贷款中最古老的伎俩。PDF结构和图像EXIF的取证检查会在每次上传时运行,并根据您配置的操作进行拒绝、审查或通过。

技术细节

如果文件已在您的服务器上,一个请求即可完成所有操作:

curl -X POST https://verification.didit.me/v3/document-ai/
  -H "x-api-key: $DIDIT_API_KEY"
  -F "document=@payslip.pdf"
  -F 'fields=[{"key":"account_holder","name":"Account holder","instruction":"Full name of the employee","type":"text","required":true,"is_full_name":true},{"key":"net_pay","name":"Net pay","instruction":"Net amount paid this period","type":"number","required":true},{"key":"pay_date","name":"Pay date","instruction":"Date of payment","type":"date","required":true}]'

您将同步获得提取的字段、姓名匹配结果和状态。没有托管流程,没有会话。

在工作流内部,相同的配置位于DOCUMENT_AI功能上,用户通过托管流程或SDK上传。然后DOCUMENT_AI会出现在决策features[]数组中,您可以从GET /v3/session/{sessionId}/decision/获取结果或订阅session.status.updated

您可以设置的规则

规则触发条件操作
document_ai_unreadable_document_action文件无法读取DECLINE · REVIEW · NO_ACTION
document_ai_missing_required_fields_action缺少必填字段DECLINE · REVIEW · NO_ACTION
document_ai_document_tampering_action取证检测到篡改DECLINE · REVIEW · NO_ACTION
document_ai_name_mismatch_action姓名字段得分低于阈值DECLINE · REVIEW · NO_ACTION
document_ai_unsupported_file_action文件类型不被接受DECLINE · REVIEW · NO_ACTION
document_ai_max_attempts_exceeded_action用户超出重试次数DECLINE · REVIEW · NO_ACTION

加上document_ai_name_match_score_threshold(0到100)和document_ai_max_retry_attempts(2到5)。

交叉引用其他步骤

自定义status_rules[]将提取的字段引用为document_ai.,并可以使用value_type: "field"将其与另一个步骤的输出进行比较。因此,document_ai.account_holder equals kyc.full_name是您编写的规则,而不是您等待的功能。

在个人工作流中,标记为is_full_name的字段会自动与已验证的身份进行比较。在企业工作流中,它与注册匹配的公司名称进行比较。

使用场景

贷款和先买后付。工资单和银行对账单,其中净收入作为数字提取,您的承保规则可以根据其采取行动,并且每次上传都会进行篡改检测。

加密货币和高价值入职。资金证明和财富来源信,与已验证的身份进行交叉核对。

拉丁美洲的企业入职。税务登记证(Constancia de situación fiscal)、RIF、公司章程(contrato social)、存在证明(certificado de existencia)。这些文件的格式由税务机关设定,并可能在不通知的情况下更改,通过指令而非模板进行读取。

受监管的专业服务。聘用函和信托契约,其中文件上的姓名必须与签署会话的人员匹配。

如何与Didit集成

  1. 打开工作流构建器并添加文档AI功能。
  2. 定义您的文档及其字段。可以从模板开始或从头构建。
  3. 设置基本规则和姓名匹配阈值。
  4. 添加任何交叉引用其他步骤的自定义状态规则。
  5. 使用POST /v3/session/创建会话并读取决策,或者如果文件已在您手中,直接调用POST /v3/document-ai/

常见问题

我可以配置多少个文档?

每个工作流最多三个,每个文档都有自己的字段列表、标题和描述。

支持哪些文件类型?

PDF和图像。任何其他文件类型都会触发document_ai_unsupported_file_action

它能处理其他语言的文档吗?

是的。您编写的标题和描述会自动翻译成所有验证语言,并且提取是指令驱动的,不受语言限制。

费用是多少?

每个文档0.20美元,无论是通过工作流还是独立的API。与所有Didit功能一样,每月前500个是免费的。

我可以在没有任何身份验证的情况下使用它吗?

是的。POST /v3/document-ai/是一个独立的服务器到服务器调用。无需会话,无需托管UI,无需身份验证步骤。

准备好开始了吗?

阅读文档AI文档独立API参考,查看定价,并免费开始

身份与欺诈基础设施。

一个 API 即可实现 KYC、KYB、交易监控和钱包筛选。5 分钟即可集成。

让 AI 总结此页面