Ves al contingut principal
Didit recapta 7,5M $ per construir la infraestructura per a identitat i frau
Didit
Torna al blog
Blog · 4 d’agost del 2026

El problema dels comptes Hydra: per què la defensa contra la destil·lació comença amb la resolució d'identitats (CA)

Anthropic va informar de 16 milions d'intercanvis a través d'aproximadament 24.000 comptes fraudulents, i una xarxa proxy gestionant més de 20.000 comptes simultàniament.

Per DiditActualitzat el
llm-distillation-defense-identity.png

El 23 de febrer de 2026, Anthropic va publicar xifres mesurades sobre un tema que la indústria de la IA havia discutit fins aleshores majoritàriament en abstracte. En campanyes de destil·lació identificades, la companyia va informar que els laboratoris "van generar més de 16 milions d'intercanvis amb Claude a través d'aproximadament 24.000 comptes fraudulents". Un detall d'aquest informe replanteja tot el problema: "una única xarxa proxy va gestionar més de 20.000 comptes fraudulents simultàniament".

Vint mil comptes. Un actor.

Aquesta és la forma de l'amenaça. La destil·lació adversària —utilitzar les sortides d'un model de frontera per entrenar una còpia més barata d'aquest— no s'executa amb un compte sospitós que fa una sol·licitud sospitosa. S'executa per una organització que distribueix una única campanya d'extracció a través de milers de comptes, instruments de pagament, dispositius i rutes de xarxa, de manera que cada compte individual sembla insignificant. Revisats un a un, cap d'ells activa cap alarma. Revisats com un gràfic, són una sola màquina.

Per això la defensa no pot residir només en el model o només en el trànsit. També ha de respondre a una pregunta que aquestes capes no poden: qui hi ha realment darrere d'aquests comptes?

Punts clau

  • Anthropic va informar de més de 16 milions d'intercanvis generats a través d'aproximadament 24.000 comptes fraudulents en campanyes de destil·lació identificades, amb una única xarxa proxy gestionant més de 20.000 comptes simultàniament.
  • La destil·lació és un problema d'accés coordinat, no un problema de sol·licitud única. La revisió per compte és estructuralment cega a això.
  • El document informatiu del Frontier Model Forum de febrer de 2026 defineix la destil·lació adversària i els seus mètodes. Per disseny, se centra en l'amenaça més que en els controls, per tant, no fa cap recomanació sobre la verificació de comptes, la identitat, la limitació de taxes o el control d'accés.
  • Les mitigacions llistades per Anthropic inclouen "verificació reforçada per a comptes educatius i de startup" juntament amb classificadors de detecció i empremtes digitals de comportament.
  • Una capa d'accés verificat fa tres coses que els controls del model no poden: redueix l'anonimat, vincula comptes que comparteixen una persona, dispositiu o xarxa, i fa que un compte regenerat mori en arribar.
  • La verificació d'identitat per si sola no impedeix l'extracció del model. És una de les tres capes, i no substitueix les altres dues.

Què va passar realment

Val la pena llegir l'informe d'Anthropic completament, però tres troballes són les més importants per a qualsevol que dissenyi controls d'accés.

El volum es va concentrar en pocs actors. Anthropic va atribuir "més de 13 milions" d'intercanvis a MiniMax, "més de 3,4 milions" a Moonshot AI i "més de 150.000" a DeepSeek. No són rascades oportunistes. Són programes industrials sostinguts.

Els comptes estaven coordinats, i la coordinació era visible en les metadades. Anthropic va descriure "patrons idèntics, mètodes de pagament compartits i sincronització coordinada" que "suggereixen 'balanceig de càrrega'" entre comptes. L'atribució va venir de "metadades de sol·licitud i indicadors d'infraestructura" — en un cas, metadades de sol·licitud que "coincidien amb els perfils públics de personal sènior de Moonshot".

Les sol·licituds es van repetir a una escala absurda. Anthropic va observar variacions de sol·licituds que arribaven "desenes de milers de vegades a través de centenars de comptes coordinats".

Llegiu aquestes tres coses juntes i sorgeix un patró. Gairebé tots els senyals que van exposar aquestes campanyes eren senyals relacionals — alguna cosa compartida entre comptes. Mètodes de pagament compartits. Sincronització compartida. Infraestructura compartida. Plantilles de prompt compartides. Cap d'ells és visible si la vostra unitat d'anàlisi és un sol compte.

Per què falla la revisió per compte

La majoria d'eines d'abús es construeixen al voltant d'un veredicte per compte. Un compte s'inscriu, es puntua, se li assigna una banda de risc i es pren una decisió. Aquest model funciona bé per a l'abús per al qual va ser dissenyat — un defraudador que utilitza una targeta robada, un spammer que bombardeja un canal.

Falla contra la destil·lació per una raó estructural específica: l'atacant controla quant de la campanya porta cada compte individual.

Si el vostre llindar de revisió és "un compte que fa 50.000 sol·licituds inusuals", l'atacant utilitza 20.000 comptes que fan 800 sol·licituds cadascun. Si el vostre llindar baixa, afegeixen comptes. L'economia els afavoreix perquè els comptes són l'entrada més barata del sistema. Una trucada a l'API d'un model de frontera té un cost marginal real; una adreça de correu electrònic no.

Així que el problema d'optimització de l'atacant és senzill: mantenir el comportament per compte per sota de qualsevol llindar per compte, i escalar horitzontalment. I funciona, perquè la defensa mesura l'objecte equivocat. Mesura comptes quan l'adversari és un actor.

Aquesta és la propietat d'hidra. Talla un compte i en apareixen dos més, perquè allò que genera els comptes mai va ser tocat. Una xarxa proxy que executa més de 20.000 comptes simultàniament, com va informar Anthropic, és la seva expressió pura — a aquesta escala, eliminar comptes un a un no és una defensa, és una tasca de manteniment.

Per vèncer una hidra has de deixar de tallar caps i començar a trobar el cos.

Les tres capes d'una defensa de destil·lació

Una defensa seriosa té tres capes, i són propietat de diferents actors.

CapaPropietat deFunció
Controls del modelEl proveïdor del modelLimitar traces de raonament sensibles, donar forma a les sortides, protegir el comportament del model
Detecció de trànsitEl proveïdor del model, o una pila de recerca/proveïdorDetectar patrons d'extracció repetitius, semànticament concentrats o coordinats
Accés verificatInfraestructura d'identitatResoldre qui hi ha darrere d'un compte, vincular identificadors compartits, aplicar polítiques a tot el que estigui connectat a un abusador confirmat

Les dues primeres capes són ben enteses i s'investiguen activament. Pel que fa al trànsit, la recent feina acadèmica és realment encoratjadora: Liu, Guo i Dong (arXiv 2606.05725, juny de 2026) emmarquen la monitorització de l'extracció com a proves de distribució de finestres de trànsit calibrades benignament, utilitzant la màxima discrepància mitjana en l'espai semàntic calibrada només amb trànsit benigne. A través de catorze parells de consultes atacant-normal de quatre escenaris d'extracció, informen d'una taxa de detecció del 100% per a casos d'atacant pur amb una taxa de falsos positius del 0,3% en consultes benignes.

Aquest és un resultat sòlid, i val la pena ser clar sobre el que significa: la detecció de trànsit funciona, i no és la capa de la qual parla Didit. L'anàlisi semàntica de les distribucions de prompts és la feina del proveïdor del model, i hauria de romandre-hi.

La tercera capa és la que té menys orientació de disseny publicada — incloent-hi en el document canònic de la indústria sobre l'amenaça.

Què cobreix el document canònic

El Frontier Model Forum va publicar el seu document informatiu sobre la destil·lació adversària el mateix dia que l'informe d'Anthropic. És un bon document. Defineix la destil·lació adversària com l'accés encobert a les sortides d'un model —normalment en violació dels termes de servei— per entrenar un model secundari que replica les capacitats del model mestre mentre evita la seva formació de seguretat. Cataloga els mètodes: exfiltració de cadena de pensament, crítica de cadena de pensament, autoavaluació de cadena de pensament, generació de prompts per a l'aprenentatge per reforç i generació de dades sintètiques. Nomena les capacitats objectiu: raonament matemàtic i científic, codificació d'agents, processament multimodal, raonament general.

També reconeix la tensió real en aquest espai — "abordar aquestes preocupacions de seguretat sense impedir la recerca legítima".

El que no conté és cap recomanació sobre la verificació de comptes, la resolució d'identitats, la limitació de taxes o el control d'accés.

Aquesta és una elecció d'abast, i sensata: el document es proposa definir l'amenaça i els seus mètodes, no prescriure controls. El disseny de la capa d'accés és simplement un document diferent.

És un document que la indústria encara no ha escrit realment — tot i que el laboratori que va mesurar l'amenaça va enumerar "verificació reforçada per a comptes educatius i de startup" entre les mitigacions en què inverteix, just al costat dels classificadors de detecció i les empremtes digitals de comportament. La capa d'accés està fent feina real a la pràctica i té molt poca orientació de disseny publicada darrere seu. D'això tracta la resta d'aquesta publicació.

Què fa realment la capa d'accés verificat

Siguem precisos amb l'afirmació aquí, perquè l'exageració és com tota aquesta categoria perd credibilitat.

La verificació d'identitat no detecta la destil·lació. No pot veure la semàntica del prompt, no sap quina capacitat s'està atacant i mai us dirà que un flux de sol·licituds sembla una exfiltració de cadena de pensament. Aquesta és la feina de la capa de trànsit.

El que fa la identitat és canviar l'estructura de costos de l'atacant de quatre maneres específiques.

Redueix l'anonimat. Un compte vinculat a una persona verificada o a una empresa registrada és un compte amb un propietari atribuïble. Això no atura l'abús, però canvia el cost i el risc de l'abús.

Vincula comptes que comparteixen alguna cosa física. Dos comptes registrats per la mateixa cara, el mateix dispositiu o la mateixa xarxa estan relacionats, tant si el seu comportament sembla relacionat com si no. Aquest és el senyal que la revisió per compte no pot produir, i és exactament la classe de senyal — mètode de pagament compartit, sincronització compartida, infraestructura compartida — que va fer aflorar les campanyes descrites per Anthropic.

Fa que la regeneració sigui cara. La propietat d'hidra depèn que els nous comptes siguin barats i desconnectats dels antics. Quan un cas d'abús confirmat es propaga a cada identificador que va tocar — cara, document, telèfon, correu electrònic, IP i dispositiu — el següent compte creat a partir de la mateixa infraestructura falla a la porta en lloc de ser atrapat 800 sol·licituds més tard.

Evita la fricció per als desenvolupadors legítims. Aquesta és la restricció que fa que tot sigui viable. La verificació aplicada a tothom és un impost al creixement. La verificació aplicada de manera adaptativa — per nivell d'accés, quota, volum de crèdit, geografia o una alerta de comportament de la capa de trànsit — posa la fricció sobre el risc i deixa el camí ràpid per al desenvolupador de confiança.

Quatre coses. Cap d'elles és "impedeix l'extracció". Totes quatre són reals.

On encaixa Didit

Didit és infraestructura per a la identitat i el frau, i les primitives que formen una capa d'accés verificat són les que ja enviem i per a les quals publiquem preus:

  • Verificació d'identitat — document d'identitat, prova de vida passiva, coincidència facial i anàlisi d'IP, inclòs a 0,33 $ per verificació, amb 500 verificacions KYC gratuïtes al mes.
  • Cerca facial 1:N — cerca biomètrica entre els usuaris verificats que la vostra pròpia aplicació ha inscrit, gratuïta amb la verificació. Aquesta és la primitiva que vincula dos comptes a una persona.
  • Anàlisi d'IP i dispositiu — 0,03 $, i inclòs en el paquet de 0,33 $. Emet DUPLICATED_IP_ADDRESS, DUPLICATED_DEVICE_FINGERPRINT, DEVICE_RECOVERED_HIGH_CONFIDENCE, AUTOMATION_FRAMEWORK_DETECTED i codis relacionats.
  • API de llistes — llistes de bloqueig en 12 tipus d'entrada, on el bloqueig d'una sessió confirmada extreu automàticament els identificadors capturats per aquesta sessió — cara, document, telèfon, correu electrònic, IP i dispositiu.
  • Autenticació biomètrica — re-verificació sense contrasenya de 0,10 $, per vincular una acció privilegiada a l'humà que es va registrar en lloc d'un token portador.
  • Verificació de negocis — des de 2,00 $ per empresa: cerca en registres, propietaris beneficiaris finals i oficials, amb cribratge d'entitats a 0,20 $ i qualsevol comprovació d'identitat vinculada per a un propietari beneficiari facturada a tarifes estàndard de verificació d'usuari. Per a accés a nivell d'organització i de recerca.

Combineu-los en qualsevol política que la vostra plataforma necessiti. La composició és la vostra arquitectura; les primitives són les parts. Totes es lliuren a través de l'API unificada /v3/ amb un preu publicat i sense mínim — algunes com el seu propi endpoint, com POST /v3/face-search/, i algunes a través d'un flux de treball de sessió, com l'autenticació biomètrica, que no té un endpoint propi.

Casos d'ús

Proveïdors de models de frontera. Vinculen l'accés d'alta quota, alt crèdit i nivell de recerca a una persona o empresa verificada, deixant els nivells gratuïts i de baix volum sense fricció.

Plataformes d'API d'IA i proveïdors d'inferència. Els revenedors i agregadors hereten l'abús sense heretar la pila de detecció. Una capa d'accés és sovint l'únic control que realment posseeixen.

Productes de codificació i agents d'IA. L'abús de prova i la creació de crèdits utilitzen la mateixa mecànica de multiplicació de comptes que la destil·lació. Les mateixes primitives de vinculació aborden ambdues.

Plataformes i mercats d'IA al núvol. La verificació a nivell d'organització respon a la pregunta "és aquesta una empresa real amb propietaris beneficiaris reals" abans que es concedeixi una quota empresarial.

Preguntes freqüents

La verificació d'identitat prevé la destil·lació de models?

No. L'extracció es prevé —en la mesura que es pugui— mitjançant controls de sortida a nivell de model i detecció de trànsit semàntic. La identitat redueix l'anonimat, vincula comptes a través d'una campanya i fa que els comptes regenerats fallin abans. És una de les tres capes.

La verificació no allunyarà els desenvolupadors legítims?

Només si l'apliqueu a tothom. El disseny que funciona és adaptatiu: verifiqueu segons el risc, el nivell, la quota, el volum de crèdit, la geografia o una alerta de comportament. La majoria dels desenvolupadors no haurien de veure mai un pas de verificació. El KYC reutilitzable de Didit és gratuït, de manera que un desenvolupador ja verificat en un altre lloc de la xarxa pot superar una comprovació sense haver de tornar-la a fer.

Didit em pot dir si un flux de sol·licituds sembla destil·lació?

No. Didit no veu els vostres prompts ni analitza la semàntica de les sol·licituds. Aquest senyal prové de la vostra pròpia capa de trànsit. El que Didit proporciona és la resolució d'identitats per adjuntar aquesta alerta a un actor i les primitives d'aplicació per actuar sobre tots els comptes connectats a ells.

Quant costa això a l'escala d'una plataforma d'IA?

La verificació es factura per comprovació exitosa sense mínims: 0,33 $ per al paquet complet d'identitat, 0,03 $ per a l'anàlisi d'IP i dispositius per si sola, gratuït per a la Cerca facial 1:N, 0,10 $ per a la reautenticació biomètrica i des de 2,00 $ per a la verificació de negocis. Com que la política és adaptativa, pagueu per la fracció d'accés que realment justifica una comprovació. Les primeres 500 verificacions KYC cada mes són gratuïtes.

Ja tenim un proveïdor de frau. Per què és diferent?

La majoria d'eines de frau retornen un veredicte per compte. El problema de la destil·lació és un problema per actor, i les primitives que vinculen comptes a un actor — cerca biomètrica 1:N entre els vostres propis usuaris, correlació de dispositius i IP, i propagació de llistes de bloqueig a cada identificador d'un únic cas confirmat — són les coses específiques que la puntuació per compte no fa.

Preparat per començar?

Comenceu amb la primitiva que produeix el senyal de vinculació que us falta avui.

Infraestructura per a identitat i frau.

Una API per a KYC, KYB, monitorització de transaccions i anàlisi de carteres. Integra-la en 5 minuts.

Demana a una IA que resumeixi aquesta pàgina