Documentos Inteligentes: Extraia Campos Personalizados de Qualquer Documento (PT-BR)
Holerites, comprovantes de fundos, declarações fiscais, atos constitutivos, extratos bancários. Os documentos mais importantes no onboarding não têm um modelo fixo.
Documentos de identidade são fáceis. Existem aproximadamente 14.000 deles no mundo, possuem layouts fixos, e um bom motor de OCR os lê sem precisar de instruções. Os documentos que realmente atrasam um onboarding são os outros: uma constancia de situación fiscal mexicana, um RIF venezuelano, uma escritura de constitución espanhola, um extrato bancário indiano, um holerite do Reino Unido, uma carta de origem de riqueza escrita pelo contador de alguém. Não há dois iguais, e nenhum modelo os cobre.
A resposta usual é um humano. Alguém abre o PDF, lê o número, digita-o em um formulário e segue em frente — centenas de vezes por semana. A Document AI é a resposta que não é um humano.
Principais pontos
- Você configura até três documentos por fluxo de trabalho, e para cada um define os campos exatos que deseja extrair — nome, tipo (
texto,número,data), uma instrução de extração e se é obrigatório. - Um modelo de visão-linguagem lê cada documento contra um esquema construído a partir das suas definições de campo e retorna valores tipados — números como números, datas como
YYYY-MM-DD. - Análises forenses de PDF e EXIF são executadas em cada upload para detectar manipulação.
- Campos extraídos podem ser referenciados a outras etapas — o nome do titular da conta em um extrato bancário contra o nome no ID verificado, por exemplo — e contra regras personalizadas que você escreve.
- $0.20 por documento. Há também uma API autônoma se você já possui o arquivo e não quer nenhuma interface de usuário hospedada.
O que a Document AI faz
Você descreve um documento uma vez. Dá a ele um título e uma descrição na tela, que são traduzidos automaticamente para todos os idiomas de verificação, e lista os pontos de dados a serem lidos. Cada campo recebe uma chave, um nome legível, uma instrução dizendo ao modelo o que procurar, um tipo e um sinalizador de obrigatoriedade.
O usuário faz o upload de um PDF ou uma imagem. A Didit o renderiza, executa a extração contra seu esquema, aplica análises forenses e, em seguida, aplica suas regras. O resultado é um status por documento que se soma ao status do recurso, com Recusado superando Em Análise superando Aprovado.
Por que isso importa
Três coisas falham no onboarding que um OCR de modelo fixo não consegue resolver.
O documento não tem um modelo. Um comprovante de fundos é o que o banco do cliente escolheu imprimir. Uma carta de origem de riqueza é prosa. A única coisa que se generaliza é um modelo que lê por significado, e não por posição.
Os dados devem concordar com o resto da sessão. Extrair "J. Silva" de um holerite vale muito pouco por si só. Extraí-lo e compará-lo com o nome completo no documento de identidade verificado é um controle. A Document AI faz a comparação e permite que você decida o que acontece quando ela falha.
O documento pode ter sido editado. Um holerite com um número diferente colado sobre o original é o truque mais antigo em empréstimos. As verificações forenses na estrutura do PDF e no EXIF da imagem são executadas em cada upload e podem recusar, revisar ou aprovar, dependendo da ação que você configurar.
Detalhes técnicos
Se o arquivo já estiver em seu servidor, uma única requisição faz tudo:
curl -X POST https://verification.didit.me/v3/document-ai/ \
-H "x-api-key: $DIDIT_API_KEY" \
-F "document=@payslip.pdf" \
-F 'fields=[{"key":"account_holder","name":"Account holder","instruction":"Full name of the employee","type":"text","required":true,"is_full_name":true},{"key":"net_pay","name":"Net pay","instruction":"Net amount paid this period","type":"number","required":true},{"key":"pay_date","name":"Pay date","instruction":"Date of payment","required":true,"type":"date"}]'
Você recebe os campos extraídos, o resultado da correspondência de nomes e um status de volta de forma síncrona. Sem fluxo hospedado, sem sessão.
Dentro de um fluxo de trabalho, a mesma configuração reside no recurso DOCUMENT_AI, e o usuário faz o upload através do fluxo hospedado ou do SDK. DOCUMENT_AI então aparece no array features[] da decisão, e você busca o resultado de GET /v3/session/{sessionId}/decision/ ou assina session.status.updated.
As regras que você pode definir
| Regra | Dispara quando | Ação |
|---|---|---|
document_ai_unreadable_document_action | O arquivo não pode ser lido | DECLINE · REVIEW · NO_ACTION |
document_ai_missing_required_fields_action | Um campo obrigatório está ausente | DECLINE · REVIEW · NO_ACTION |
document_ai_document_tampering_action | Análises forenses detectam manipulação | DECLINE · REVIEW · NO_ACTION |
document_ai_name_mismatch_action | O campo de nome pontua abaixo do limite | DECLINE · REVIEW · NO_ACTION |
document_ai_unsupported_file_action | O tipo de arquivo não é aceito | DECLINE · REVIEW · NO_ACTION |
document_ai_max_attempts_exceeded_action | O usuário excede as tentativas | DECLINE · REVIEW · NO_ACTION |
Além de document_ai_name_match_score_threshold de 0 a 100 e document_ai_max_retry_attempts de 2 a 5.
Referência cruzada de outras etapas
status_rules[] personalizadas referenciam um campo extraído como document_ai. e podem compará-lo com a saída de outra etapa usando value_type: "field". Assim, document_ai.account_holder equals kyc.full_name é uma regra que você escreve, não um recurso que você espera.
Em um fluxo de trabalho de pessoa, um campo marcado como is_full_name é comparado automaticamente com a identidade verificada. Em um fluxo de trabalho de negócios, é comparado com o nome da empresa correspondente ao registro.
Casos de uso
Empréstimos e BNPL. Holerites e extratos bancários, com o salário líquido extraído como um número sobre o qual suas regras de subscrição podem atuar, e detecção de adulteração em cada upload.
Onboarding de cripto e alto valor. Comprovantes de fundos e cartas de origem de riqueza, verificados contra a identidade verificada.
Onboarding de negócios na América Latina. Constancia de situación fiscal, RIF, contrato social, certificado de existência. Documentos cujo formato é definido por uma autoridade fiscal e muda sem aviso prévio, lidos por instrução em vez de por modelo.
Serviços profissionais regulamentados. Cartas de engajamento e escrituras de fideicomisso, onde o nome no documento deve corresponder à pessoa que assinou a sessão.
Como integrar com a Didit
- Abra o construtor de fluxo de trabalho e adicione o recurso Document AI.
- Defina seus documentos e seus campos. Comece de um modelo ou construa do zero.
- Defina as regras básicas e o limite de correspondência de nomes.
- Adicione quaisquer regras de status personalizadas que façam referência cruzada a outras etapas.
- Crie sessões com
POST /v3/session/e leia a decisão, ou chamePOST /v3/document-ai/diretamente se você já possui o arquivo.
Perguntas frequentes
Quantos documentos posso configurar?
Até três por fluxo de trabalho, cada um com sua própria lista de campos, título e descrição.
Quais tipos de arquivo funcionam?
PDF e imagens. Qualquer outra coisa aciona document_ai_unsupported_file_action.
Ele lida com documentos em outros idiomas?
Sim. Os títulos e descrições que você escreve são traduzidos automaticamente para todos os idiomas de verificação, e a extração é orientada por instrução, e não bloqueada por idioma.
Qual é o custo?
$0.20 por documento, seja através do fluxo de trabalho ou da API autônoma. Os primeiros 500 por mês são gratuitos, como em todos os recursos da Didit.
Posso usá-lo sem nenhuma verificação de identidade?
Sim. POST /v3/document-ai/ é uma chamada autônoma de servidor para servidor. Nenhuma sessão, nenhuma interface de usuário hospedada, nenhuma etapa de identidade necessária.
Pronto para começar?
Leia a documentação da Document AI, a referência da API autônoma, verifique os preços e comece gratuitamente.
Artigos relacionados
- Altify e Didit: Parceria para Otimizar Onboarding e Triagem de Investidores
- Damos à IA um trabalho simples: tentar quebrar o Didit
- Conheça seu Agente: Por que toda Plataforma de LLM Precisará de Verificação de Identidade (PT-BR)
- Alerta A7 do Reino Unido: A Rede Oculta por Trás da Evasão de Sanções
- O Código de Comerciante Que Decidiu o KYC Para Memecoins
- Coreia do Sul permite que a Upbit use registros governamentais para KYC