Documentos Inteligentes: extraia campos específicos de qualquer arquivo (PT-BR-1)
Holerites, comprovantes de fundos, declarações fiscais, contratos sociais, extratos bancários. Os documentos mais importantes para o onboarding são aqueles sem um modelo fixo.

Documentos de identidade são fáceis. Existem aproximadamente 14.000 tipos deles no mundo, possuem layouts fixos e um bom motor de OCR os lê sem a necessidade de instruções. Os documentos que realmente atrasam um processo de onboarding são os outros: uma constancia de situación fiscal mexicana, um RIF venezuelano, uma escritura de constitución espanhola, um extrato bancário indiano, um holerite do Reino Unido, uma carta de origem de patrimônio escrita pelo contador de alguém. Não há dois iguais, e nenhum modelo os abrange.
A resposta usual é um ser humano. Alguém abre o PDF, lê o número, digita-o em um formulário e segue em frente — algumas centenas de vezes por semana. A Document AI é a resposta que não é um ser humano.
Principais pontos
- Você configura até três documentos por fluxo de trabalho, e para cada um define os campos exatos que deseja extrair — nome, tipo (
texto,número,data), uma instrução de extração e se é obrigatório. - Um modelo de visão-linguagem lê cada documento conforme um esquema construído a partir das suas definições de campo e retorna valores tipados — números como números, datas como
AAAA-MM-DD. - Análises forenses de PDF e EXIF são executadas em cada upload para detectar manipulações.
- Os campos extraídos podem ser referenciados cruzadamente com outras etapas — o nome do titular da conta em um extrato bancário contra o nome no documento de identidade verificado, por exemplo — e contra regras personalizadas que você escreve.
- $0.20 por documento. Há também uma API autônoma se você já possui o arquivo e não deseja nenhuma interface de usuário hospedada.
O que a Document AI faz
Você descreve um documento uma vez. Você atribui um título e uma descrição na tela, que são automaticamente traduzidos para todos os idiomas de verificação, e lista os pontos de dados a serem lidos. Cada campo recebe uma chave, um nome legível, uma instrução que indica ao modelo o que procurar, um tipo e um sinalizador de obrigatoriedade.
O usuário faz o upload de um PDF ou uma imagem. A Didit o renderiza, executa a extração contra o seu esquema, aplica análises forenses e, em seguida, aplica suas regras. O resultado é um status por documento que se integra ao status do recurso, com Recusado superando Em Análise, que supera Aprovado.
Por que isso importa
Três coisas quebram no onboarding que um OCR de modelo fixo não consegue resolver.
O documento não tem um modelo. Um comprovante de fundos é o que o banco do cliente decidiu imprimir. Uma carta de origem de patrimônio é prosa. A única coisa que se generaliza é um modelo que lê para significado, e não para posição.
Os dados devem concordar com o resto da sessão. Extrair "J. Silva" de um holerite vale muito pouco por si só. Extraí-lo e compará-lo com o nome completo no documento de identidade verificado é um controle. A Document AI faz a comparação e permite que você decida o que acontece quando falha.
O documento pode ter sido editado. Um holerite com um número diferente colado sobre o original é o truque mais antigo em empréstimos. Verificações forenses na estrutura do PDF e no EXIF da imagem são executadas em cada upload e podem recusar, revisar ou aprovar, dependendo da ação que você configurar.
Detalhes técnicos
Se o arquivo já estiver no seu servidor, uma única solicitação faz tudo:
curl -X POST https://verification.didit.me/v3/document-ai/ \
-H "x-api-key: $DIDIT_API_KEY" \
-F "document=@payslip.pdf" \
-F 'fields=[{"key":"account_holder","name":"Account holder","instruction":"Full name of the employee","type":"text","required":true,"is_full_name":true},{"key":"net_pay","name":"Net pay","instruction":"Net amount paid this period","type":"number","required":true},{"key":"pay_date","name":"Pay date","instruction":"Date of payment","type":"date","required":true}]'
Você recebe os campos extraídos, o resultado da correspondência de nomes e um status de volta de forma síncrona. Nenhum fluxo hospedado, nenhuma sessão.
Dentro de um fluxo de trabalho, a mesma configuração reside no recurso DOCUMENT_AI, e o usuário faz o upload através do fluxo hospedado ou do SDK. DOCUMENT_AI então aparece no array features[] da decisão, e você busca o resultado de GET /v3/session/{sessionId}/decision/ ou se inscreve em session.status.updated.
As regras que você pode definir
| Regra | Dispara quando | Ação |
|---|---|---|
document_ai_unreadable_document_action | O arquivo não pode ser lido | DECLINE · REVIEW · NO_ACTION |
document_ai_missing_required_fields_action | Um campo obrigatório está ausente | DECLINE · REVIEW · NO_ACTION |
document_ai_document_tampering_action | A perícia detecta manipulação | DECLINE · REVIEW · NO_ACTION |
document_ai_name_mismatch_action | O campo de nome pontua abaixo do limite | DECLINE · REVIEW · NO_ACTION |
document_ai_unsupported_file_action | O tipo de arquivo não é aceito | DECLINE · REVIEW · NO_ACTION |
document_ai_max_attempts_exceeded_action | O usuário esgota as tentativas | DECLINE · REVIEW · NO_ACTION |
Além de document_ai_name_match_score_threshold de 0 a 100 e document_ai_max_retry_attempts de 2 a 5.
Referência cruzada de outras etapas
As status_rules[] personalizadas referenciam um campo extraído como document_ai. e podem compará-lo com a saída de outra etapa usando value_type: "field". Assim, document_ai.account_holder equals kyc.full_name é uma regra que você escreve, não um recurso pelo qual você espera.
Em um fluxo de trabalho de pessoa, um campo marcado is_full_name é comparado automaticamente com a identidade verificada. Em um fluxo de trabalho de negócio, é comparado com o nome da empresa correspondente ao registro.
Casos de uso
Empréstimos e BNPL. Holerites e extratos bancários, com o salário líquido extraído como um número que suas regras de subscrição podem usar, e detecção de adulteração em cada upload.
Onboarding de cripto e alto valor. Comprovantes de fundos e cartas de origem de patrimônio, validados em relação à identidade verificada.
Onboarding de negócios na América Latina. Constancia de situación fiscal, RIF, contrato social, certificado de existência. Documentos cujo formato é definido por uma autoridade fiscal e muda sem aviso prévio, lidos por instrução e não por modelo.
Serviços profissionais regulamentados. Cartas de engajamento e escrituras de fideicomisso, onde o nome no documento deve corresponder à pessoa que assinou a sessão.
Como integrar com a Didit
- Abra o construtor de fluxo de trabalho e adicione o recurso Document AI.
- Defina seus documentos e seus campos. Comece de um modelo ou construa do zero.
- Defina as regras básicas e o limite de correspondência de nomes.
- Adicione quaisquer regras de status personalizadas que façam referência cruzada a outras etapas.
- Crie sessões com
POST /v3/session/e leia a decisão, ou chamePOST /v3/document-ai/diretamente se você já possui o arquivo.
Perguntas frequentes
Quantos documentos posso configurar?
Até três por fluxo de trabalho, cada um com sua própria lista de campos, título e descrição.
Quais tipos de arquivo funcionam?
PDF e imagens. Qualquer outra coisa aciona document_ai_unsupported_file_action.
Ele lida com documentos em outros idiomas?
Sim. Os títulos e descrições que você escreve são traduzidos automaticamente para todos os idiomas de verificação, e a extração é orientada por instrução, e não bloqueada por idioma.
Quanto custa?
$0.20 por documento, seja através do fluxo de trabalho ou da API autônoma. Os primeiros 500 por mês são gratuitos, assim como todos os recursos da Didit.
Posso usá-lo sem qualquer verificação de identidade?
Sim. POST /v3/document-ai/ é uma chamada autônoma de servidor para servidor. Nenhuma sessão, nenhuma interface de usuário hospedada, nenhuma etapa de identidade necessária.
Pronto para começar?
Leia a documentação da Document AI, a referência da API autônoma, verifique os preços e comece gratuitamente.
Artigos relacionados
- Documentos Inteligentes: extraia campos específicos de qualquer arquivo (PT-BR-1)
- AML/CTF Tranche 2 na Austrália: As Novas Exigências de Due Diligence do Cliente (PT-BR)
- A regra da União Europeia para deepfakes entra em vigor, focando na ferramenta, não na fraude
- Inteligência Artificial: Uma Dupla Ameaça na Verificação de Identidade em Jogos de Azar
- A regra de identidade para stablecoins: emissão e resgate, e o que vem depois
- Egito Assume Custos de Atualização KYC: Uma Análise da Nova Abordagem