O Manual de Defesa Contra a Extração de Modelos (PT-PT)
O manual completo: o que cada uma das três camadas de defesa possui, os quatro primitivos que constroem a camada de acesso, o design de acionamento e aplicação, o modelo de custos e os limites honestos do que a identidade pode.

Tudo neste pilar se encaixa numa única arquitetura. Esta é a arquitetura, apresentada de forma compacta — o que cada camada possui, quais primitivos constroem a camada de acesso, como os gatilhos e a aplicação se encaixam, quanto custa e onde deixa de funcionar.
Se for para ler um artigo desta série, leia este. Se for construir a coisa, leia os outros também.
Principais conclusões
- Três camadas: controlos de modelo, deteção de tráfego, acesso verificado. As duas primeiras são da sua responsabilidade. A terceira é composta por primitivos publicados e com preço definido.
- Quatro primitivos da camada de acesso: recolher (dispositivo e rede), ligar (biométrico 1:N), vincular (verificação de identidade e empresarial), aplicar (propagação de lista de bloqueio).
- O nível mais barato faz a maior parte do trabalho. Recolha a 0,03 $ em cada conta pagante — sem isso, qualquer investigação posterior é impossível.
- Os gatilhos devem ser acionados em transições de acesso e alertas comportamentais, nunca por temporizador.
- Custo realista para uma plataforma com 100.000 programadores: aproximadamente 800–1.200 $ por mês, com 500 verificações KYC gratuitas por mês.
- A verificação de identidade não impede a extração de modelos. Aumenta o custo, reduz o anonimato e encurta a vida útil das contas regeneradas. Qualquer pessoa que afirme mais do que isso está a exagerar.
Primeira camada: o que já possui
Antes de adicionar qualquer coisa, seja claro sobre as duas camadas que são suas e permanecerão suas.
Controlos de modelo — limitar rastros de raciocínio sensíveis, moldar saídas, restringir o que uma resposta revela sobre como foi produzida. O relatório do Frontier Model Forum cataloga o que o atacante procura aqui: exfiltração de cadeia de pensamento, crítica de cadeia de pensamento, classificação automática de cadeia de pensamento, geração de prompts para aprendizagem por reforço e geração de dados sintéticos. Cada um visa o que o modelo emite. Apenas o fornecedor do modelo pode mudar isso.
Deteção de tráfego — identificar padrões de solicitação repetitivos, semanticamente concentrados ou coordenados. Esta camada está a avançar rapidamente. Liu, Guo e Dong (arXiv 2606.05725) tratam a monitorização de extração como um teste de distribuição de janela de tráfego calibrado benignamente, usando a discrepância máxima média no espaço semântico, e relatam uma taxa de deteção de 100% para casos de puro atacante com uma taxa de falsos positivos de 0,3% em catorze pares de consultas atacante-normal.
Nenhum destes é um problema de identidade, e nenhum fornecedor de identidade deveria estar a tentar vender-lhe qualquer um deles. O que a infraestrutura de identidade faz é responder à pergunta que essas camadas levantam e não conseguem resolver: esta conta está a comportar-se de forma estranha — quantas outras contas são do mesmo ator, e o que faço com todas elas?
Os quatro primitivos
1. Recolher — 0,03 $, em cada conta pagante
Execute a análise de IP e dispositivo em cada conta no seu nível pago mais barato. Não para decidir nada. Para ter os dados.
Os códigos que está a comprar são DUPLICATED_DEVICE_FINGERPRINT, DUPLICATED_IP_ADDRESS, DEVICE_RECOVERED_HIGH_CONFIDENCE, AUTOMATION_FRAMEWORK_DETECTED, DEVICE_EMULATOR_DETECTED, DEVICE_ROOTED_OR_JAILBROKEN, DEVICE_RUNTIME_HOOKING_DETECTED, DEVICE_APP_TAMPERED e a família de rede.
Esta é a decisão de maior alavancagem no manual e a mais frequentemente ignorada, porque no primeiro dia parece não fazer nada. É um substrato de correlação. Quando a sua camada de tráfego sinaliza uma conta no nono mês, a diferença entre uma proibição de uma conta e um cluster de trinta contas depende inteiramente de ter recolhido dados no primeiro mês. Não pode fazer uma adaptação retroativa. As sessões desapareceram.
2. Ligar — gratuito
A Pesquisa Facial 1:N pesquisa um rosto em todas as verificações aprovadas que a sua aplicação realizou, retornando cada correspondência com os seus próprios vendor_data anexados. Gratuito com a verificação Didit, em menos de dois segundos, e é executado automaticamente durante a verificação de vivacidade dentro de uma sessão de verificação.
Este é o primitivo que transforma contas em atores. Vinte mil contas é um grande número. Vinte mil rostos não é algo que um operador tenha.
3. Vincular — 0,33 $ individual, a partir de 2,00 $ organizacional
Verificação de identidade completa em transições de acesso que envolvem risco real: aumentos de quota, concessões de crédito, emissão de chaves, atualizações de nível de capacidade. Documento de identificação, vivacidade passiva, correspondência facial e análise de IP a 0,33 $, com as primeiras 500 por mês gratuitas.
Para organizações, níveis de pesquisa e educacionais — as categorias que a Anthropic especificamente nomeou em "verificação reforçada para contas educacionais e de startups" — a verificação empresarial a partir de 2,00 $ resolve o status de registo, beneficiários efetivos e diretores, com verificação de identidade vinculada disponível para cada beneficiário efetivo da mesma sessão.
A reautenticação biométrica a 0,10 $ cobre o caso em que a conta foi verificada há muito tempo e a questão é se a mesma pessoa ainda a está a operar.
4. Aplicar — incluído
Quando um caso é confirmado, adicione à lista de bloqueio usando reference_session_id e Didit extrai automaticamente o identificador correto dessa sessão — rosto, documento, telefone, e-mail, IP ou dispositivo — em 12 tipos de entrada, com a entrada vinculada à sua sessão de origem. As entradas entram em vigor imediatamente no momento da verificação. ip_address aceita intervalos CIDR quando a evidência aponta para a infraestrutura.
As listas de permissão nos mesmos 12 tipos mantêm os parceiros de design e as equipas de engenharia empresarial fora de qualquer caminho de escalonamento, o que torna uma política rigorosa sustentável.
O design do gatilho
Primitivos sem gatilhos são um centro de custos. As regras que se mantêm:
Dispare em transições de acesso. Aumento de quota, concessão de crédito, nova chave de API, atualização de nível, novo membro da equipa privilegiado, mudança de proprietário da faturação.
Dispare nos seus próprios alertas comportamentais. Este é o gatilho de maior valor no design, e é o ponto de integração entre as camadas. A sua deteção semântica produz um sinal que a infraestrutura de identidade não consegue; a identidade produz a resolução e aplicação que um classificador semântico não consegue. Nenhum substitui o outro.
Dispare em sinais de ligação. DEVICE_RECOVERED_HIGH_CONFIDENCE numa nova conta, ou um rosto que corresponde a um utilizador verificado existente, justifica um aumento, independentemente do que está a ser solicitado.
Não dispare por temporizador. A reverificação periódica de todos custa em proporção à sua base de utilizadores e protege em proporção a nada.
Não dispare no registo. Deixe as pessoas registarem-se, lerem a documentação, obterem uma chave e fazerem chamadas reais. A verificação no registo converte pior e protege menos.
O modelo de custos
Considere uma plataforma com 100.000 programadores registados e uma distribuição ilustrativa:
| Nível | Contas | Verificação | Unidade | Mensal |
|---|---|---|---|---|
| Gratuito | 85.000 | nenhuma | 0 $ | 0 $ |
| Autoatendimento pago | 12.000 | IP + dispositivo | 0,03 $ | 360 $ uma única vez, depois apenas novas contas |
| Alta quota / crédito | 2.500 | pacote completo | 0,33 $ | 825 $ uma única vez, depois apenas novas contas |
| Organização / pesquisa | 500 | verificação empresarial | a partir de 2,00 $ | 1.000 $ uma única vez, depois apenas novas contas |
| Aumento em alertas | ~200 / mês | autenticação biométrica | 0,10 $ | 20 $ |
As colunas de custo único importam: a verificação é por conta, não por mês. O custo em regime permanente é impulsionado por novas contas que entram em cada nível, mais aumentos acionados por alertas — para a maioria das plataformas, aproximadamente 800 a 1.200 $ por mês nesta escala. As primeiras 500 verificações KYC por mês são gratuitas, tudo é pago por sucesso e não há mínimos ou licenças de utilizador.
Compare isso com as campanhas que a Anthropic mediu — mais de 16 milhões de trocas através de aproximadamente 24.000 contas fraudulentas. O custo de inferência de 16 milhões de trocas não é um número na casa das centenas de dólares.
A sua distribuição será diferente da tabela. A conclusão estrutural não: a verificação mais cara aplica-se ao menor número de contas, e a verificação que se aplica ao maior número de contas é gratuita.
A ordem de implementação
- Comece por recolher. Análise de IP e dispositivo em cada conta pagante. Faça isso antes de qualquer outra coisa, porque é o único passo que se torna mais difícil quanto mais tempo esperar.
- Instrumentar, não aplicar. Execute por um mês e veja o que os códigos realmente dizem sobre a sua população. A linha de base de cada plataforma é diferente e aplicar contra uma linha de base assumida gera falsos positivos.
- Ligue o caminho do alerta. Conecte os seus alertas da camada de tráfego a um gatilho de verificação. Esta é a integração que torna ambas as camadas mais valiosas.
- Adicione a vinculação nos níveis superiores. Verificação completa em escalonamento de alta quota e crédito; verificação empresarial em níveis de organização e pesquisa.
- Construa o manual de aplicação. Resolva o cluster primeiro, depois adicione à lista de bloqueio da sessão confirmada em todos os tipos de entrada, depois verifique se a aplicação foi bem-sucedida. Aplicar antes de resolver proíbe uma conta e avisa o operador.
- Permita os seus amigos. Antes de apertar qualquer coisa, exclua explicitamente os parceiros de design e as equipas de engenharia empresarial.
Onde isto deixa de funcionar
Um manual honesto declara os seus próprios limites.
Não deteta extração. A infraestrutura de identidade nunca vê os seus prompts. Se a sua camada de tráfego for fraca, a camada de acesso não compensará — ela resolverá fielmente atores que nunca sinalizou.
Um operador determinado e bem financiado ainda pode entrar. Pagar a pessoas reais com documentos reais em dispositivos reais para abrir contas derrota todos os controlos de identidade, porque as contas são genuinamente distintas. O que isto muda é o preço. A criação de contas que custava aproximadamente nada agora custa recrutamento, coordenação e despesas gerais por pessoa — e a rede resultante é menor e mais lenta para regenerar.
Cada camada produz falsos positivos. Escritórios partilhados produzem DUPLICATED_IP_ADDRESS. Famílias partilham dispositivos. Programadores detêm legitimamente duas contas. É por isso que os sinais duplicados são informativos por padrão e porque a política é sua para definir.
A verificação tem atrito real e custo real para o seu funil. A estratificação existe para manter ambos longe das pessoas que nunca deveriam encontrá-los, mas o efeito não é zero. Meça-o.
É uma função de custo, não uma parede. O sucesso não é "a extração tornou-se impossível". O sucesso é que uma campanha que exigia 20.000 contas agora exige 20.000 identidades verificadas, que cada remoção custa ao operador mais do que um endereço de e-mail para substituir, e que um único caso confirmado se propaga por tudo o que tocou.
Perguntas frequentes
Qual é a coisa mais vantajosa a fazer primeiro?
Recolha sinais de dispositivo e rede em cada conta pagante a 0,03 $. Parece não fazer nada no primeiro dia, e é a razão pela qual qualquer investigação posterior é possível. Não pode ser adaptado retroativamente.
Precisamos de todos os quatro primitivos?
Não. Recolher e ligar proporcionam a maior parte do valor analítico. Vincular e aplicar são o que lhe permite agir sobre isso. Comece por recolher.
Como isto interage com um classificador de deteção que já executamos?
Eles compõem-se. O seu classificador diz esta conta está a fazer algo errado. A ligação de rosto, dispositivo e rede diz são trinta contas, não uma. A propagação da lista de bloqueio faz com que a resposta cubra todas elas. Nenhuma camada faz o trabalho da outra.
A Didit está implementada em empresas de IA de ponta?
Não discutimos quem usa a Didit. Tudo o que é descrito aqui é construído a partir de primitivos documentados e com preços públicos que qualquer equipa pode avaliar contra a sua própria arquitetura, começando com 500 verificações KYC gratuitas por mês.
E quanto à verificação de agentes de IA em vez de humanos?
A identidade do agente é um problema real e não resolvido, e o servidor MCP da Didit está ativo e gratuito. Mas as campanhas de extração medidas até à data são executadas em contas registadas por humanos em escala, que é o problema que este manual aborda.
Alguma destas medidas impede a destilação por completo?
Não. Os controlos de saída ao nível do modelo e a deteção de tráfego semântico continuam a ser necessários e são da responsabilidade do fornecedor do modelo. A camada de acesso reduz o anonimato, resolve atores em várias contas, aumenta o custo de regeneração e dá aos seus alertas existentes algo sobre o qual agir. Essa é a afirmação, e é toda a afirmação.
Pronto para começar?
Construa a camada de acesso a partir de primitivos que pode precificar antes de se comprometer com qualquer um deles.
- Leia a documentação — Pesquisa Facial 1:N, Análise de IP e Dispositivo, API de Listas, Autenticação Biométrica e Verificação Empresarial.
- Veja os produtos — Verificação de Utilizador e Verificação Empresarial.
- Verifique os preços — cada módulo tem preços públicos: 0,03 $ para dispositivo e rede, pesquisa facial 1:N gratuita, 0,33 $ para o pacote completo, 0,10 $ para autenticação biométrica, a partir de 2,00 $ para verificação empresarial. Sem mínimos.
- Comece gratuitamente — business.didit.me. 500 verificações KYC por mês sem custo, pago por sucesso depois disso.
Artigos relacionados
- O Problema da Conta Hydra: Porquê a Defesa contra a Destilação Começa com a Resolução de Identidade (PT-PT)
- Verificação Empresarial para Acesso à API de IA: Quem Controla Realmente Esta Conta? (PT-PT)
- Acesso Verificado à API para Fornecedores de Modelos de IA: Uma Arquitetura por Níveis de Risco (PT-PT)
- Reconhecimento Facial 1:N: Encontrar Todas as Contas Controladas por uma Pessoa (PT-PT)
- Verificação Biométrica para Acesso a APIs de IA: Associar Privilégios a uma Pessoa (PT-PT)
- Redes de Contas Hydra: Como 20.000 Contas Se Tornam Um Único Ator (PT-PT)