El problema de la cuenta Hydra: Por qué la defensa de destilación comienza con la resolución de identidad (ES)
Anthropic informó 16 millones de intercambios a través de aproximadamente 24,000 cuentas fraudulentas, y una red de proxies operando más de 20,000 cuentas simultáneamente.

El 23 de febrero de 2026, Anthropic publicó cifras medidas sobre algo que la industria de la IA había discutido hasta entonces principalmente en abstracto. En campañas de destilación identificadas, la compañía informó que los laboratorios "generaron más de 16 millones de intercambios con Claude a través de aproximadamente 24.000 cuentas fraudulentas". Un detalle en ese informe replantea todo el problema: "una única red de proxies gestionó más de 20.000 cuentas fraudulentas simultáneamente".
Veinte mil cuentas. Un solo actor.
Esa es la forma de la amenaza. La destilación adversaria —usar las salidas de un modelo frontera para entrenar una copia más barata del mismo— no es ejecutada por una cuenta sospechosa que realiza una solicitud sospechosa. Es ejecutada por una organización que distribuye una única campaña de extracción a través de miles de cuentas, instrumentos de pago, dispositivos y rutas de red, de modo que cada cuenta individual parece insignificante. Revisadas una por una, ninguna activa ninguna alerta. Revisadas como un grafo, son una sola máquina.
Por eso, la defensa no puede residir solo en el modelo o solo en el tráfico. También tiene que responder una pregunta que esas capas no pueden: ¿quién está realmente detrás de estas cuentas?
Puntos clave
- Anthropic informó más de 16 millones de intercambios generados a través de aproximadamente 24.000 cuentas fraudulentas en campañas de destilación identificadas, con una única red de proxies operando más de 20.000 cuentas simultáneamente.
- La destilación es un problema de acceso coordinado, no un problema de una sola solicitud. La revisión por cuenta es estructuralmente ciega a ello.
- El informe de febrero de 2026 del Frontier Model Forum define la destilación adversaria y sus métodos. Por diseño, se limita a la amenaza y no a los controles, por lo que no hace ninguna recomendación sobre verificación de cuentas, identidad, limitación de tasas o control de acceso.
- Las mitigaciones listadas por Anthropic incluyen "verificación reforzada para cuentas educativas y de startups" junto con clasificadores de detección y huellas de comportamiento.
- Una capa de acceso verificado hace tres cosas que los controles del modelo no pueden: reduce el anonimato, vincula cuentas que comparten una persona, dispositivo o red, y hace que una cuenta regenerada muera al llegar.
- La verificación de identidad por sí sola no previene la extracción de modelos. Es una de tres capas, y no reemplaza a las otras dos.
Lo que realmente sucedió
El informe de Anthropic merece ser leído en su totalidad, pero tres hallazgos son los más importantes para cualquiera que diseñe controles de acceso.
El volumen se concentró en unos pocos actores. Anthropic atribuyó "más de 13 millones" de intercambios a MiniMax, "más de 3,4 millones" a Moonshot AI, y "más de 150.000" a DeepSeek. Estos no son raspados oportunistas. Son programas industriales sostenidos.
Las cuentas estaban coordinadas, y la coordinación era visible en los metadatos. Anthropic describió "patrones idénticos, métodos de pago compartidos y sincronización coordinada" que "sugerían 'balanceo de carga'" entre cuentas. La atribución provino de "metadatos de solicitud e indicadores de infraestructura" — en un caso, metadatos de solicitud que "coincidían con los perfiles públicos del personal sénior de Moonshot".
Los prompts se repetían a una escala absurda. Anthropic notó variaciones de prompts llegando "decenas de miles de veces a través de cientos de cuentas coordinadas".
Lea esos tres juntos y emerge un patrón. Casi cada señal que expuso estas campañas era una señal relacional — algo compartido entre cuentas. Métodos de pago compartidos. Sincronización compartida. Infraestructura compartida. Plantillas de prompts compartidas. Ninguna de ellas es visible si su unidad de análisis es una sola cuenta.
Por qué falla la revisión por cuenta
La mayoría de las herramientas contra el abuso se construyen en torno a un veredicto por cuenta. Una cuenta se registra, se califica, obtiene una banda de riesgo y se toma una decisión. Ese modelo funciona bien para el abuso para el que fue diseñado: un estafador que usa una tarjeta robada, un spammer que bombardea un canal.
Falla contra la destilación por una razón estructural específica: el atacante controla cuánto de la campaña lleva cada cuenta.
Si su umbral de revisión es "una cuenta que realiza 50.000 solicitudes inusuales", el atacante utiliza 20.000 cuentas que realizan 800 solicitudes cada una. Si su umbral baja, añaden cuentas. La economía les favorece porque las cuentas son el insumo más barato del sistema. Una llamada a la API de un modelo frontera tiene un coste marginal real; una dirección de correo electrónico no.
Así que el problema de optimización del atacante es simple: mantener el comportamiento por cuenta por debajo del umbral por cuenta, y escalar horizontalmente. Y funciona, porque la defensa está midiendo el objeto equivocado. Está midiendo cuentas cuando el adversario es un actor.
Esta es la propiedad de la hidra. Corta una cuenta y aparecen dos más, porque lo que genera las cuentas nunca fue tocado. Una red de proxies que ejecuta más de 20.000 cuentas simultáneamente, como informó Anthropic, es la expresión pura de ello — a esa escala, eliminar cuentas una por una no es una defensa, es una tarea de mantenimiento.
Para vencer a una hidra, hay que dejar de cortar cabezas y empezar a encontrar el cuerpo.
Las tres capas de una defensa de destilación
Una defensa seria tiene tres capas, y son de propiedad diferente.
| Capa | Propietario | Rol |
|---|---|---|
| Controles del modelo | El proveedor del modelo | Limitar rastros de razonamiento sensibles, dar forma a las salidas, proteger el comportamiento del modelo |
| Detección de tráfico | El proveedor del modelo, o una pila de investigación/proveedor | Detectar patrones de extracción repetitivos, semánticamente concentrados o coordinados |
| Acceso verificado | Infraestructura de identidad | Resolver quién está detrás de una cuenta, vincular identificadores compartidos, aplicar políticas en todo lo conectado a un abusador confirmado |
Las dos primeras capas son bien comprendidas y activamente investigadas. En el lado del tráfico, el trabajo académico reciente es realmente alentador: Liu, Guo y Dong (arXiv 2606.05725, junio de 2026) enmarcan la monitorización de la extracción como pruebas de distribución de ventanas de tráfico calibradas de forma benigna, utilizando la máxima discrepancia media en el espacio semántico calibrada solo en tráfico benigno. A través de catorce pares de consultas atacante-normal de cuatro escenarios de extracción, informan una tasa de detección del 100% para casos de atacante puro con una tasa de falsos positivos del 0,3% en consultas benignas.
Ese es un resultado sólido, y vale la pena ser claro sobre lo que significa: la detección de tráfico funciona, y no es la capa de la que Didit está hablando. El análisis semántico de las distribuciones de prompts es trabajo del proveedor del modelo, y debe permanecer allí.
La tercera capa es la que tiene la menor guía de diseño publicada, incluso en el propio informe canónico de la industria sobre la amenaza.
Lo que cubre el informe canónico
El Frontier Model Forum publicó su informe sobre la destilación adversaria el mismo día que el informe de Anthropic. Es un buen documento. Define la destilación adversaria como el acceso encubierto a las salidas de un modelo —típicamente en violación de los términos de servicio— para entrenar un modelo secundario que replica las capacidades del modelo "maestro" mientras evade su entrenamiento de seguridad. Cataloga los métodos: exfiltración de cadena de pensamiento, crítica de cadena de pensamiento, calificación automática de cadena de pensamiento, generación de prompts para aprendizaje por refuerzo y generación de datos sintéticos. Nombra las capacidades objetivo: razonamiento matemático y científico, codificación de agentes, procesamiento multimodal, razonamiento general.
También reconoce la tensión real en este espacio: "abordar estas preocupaciones de seguridad sin impedir la investigación legítima".
Lo que no contiene es ninguna recomendación sobre verificación de cuentas, resolución de identidad, limitación de tasas o control de acceso.
Esa es una elección de alcance, y una sensata: el informe se propone definir la amenaza y sus métodos, no prescribir controles. El diseño de la capa de acceso es simplemente un documento diferente.
Es un documento que la industria aún no ha escrito realmente, aunque el laboratorio que midió la amenaza enumeró la "verificación reforzada para cuentas educativas y de startups" entre las mitigaciones en las que invierte, junto con clasificadores de detección y huellas de comportamiento. La capa de acceso está realizando un trabajo real en la práctica y tiene muy poca guía de diseño publicada detrás. De eso trata el resto de esta publicación.
Lo que realmente hace la capa de acceso verificado
Sea preciso con esta afirmación, porque exagerar es cómo esta categoría pierde credibilidad.
La verificación de identidad no detecta la destilación. No puede ver la semántica de los prompts, no sabe qué capacidad se está atacando, y nunca le dirá que un flujo de solicitudes parece una exfiltración de cadena de pensamiento. Ese es el trabajo de la capa de tráfico.
Lo que hace la identidad es cambiar la estructura de costos del atacante de cuatro maneras específicas.
Reduce el anonimato. Una cuenta vinculada a una persona verificada o a una empresa registrada es una cuenta con un propietario atribuible. Eso no detiene el abuso, pero cambia el costo y el riesgo del abuso.
Vincula cuentas que comparten algo físico. Dos cuentas registradas por la misma cara, el mismo dispositivo o la misma red están relacionadas, independientemente de si su comportamiento parece relacionado. Esta es la señal que la revisión por cuenta no puede producir, y es exactamente la clase de señal —método de pago compartido, sincronización compartida, infraestructura compartida— que reveló las campañas descritas por Anthropic.
Hace que la regeneración sea costosa. La propiedad de la hidra depende de que las cuentas nuevas sean baratas y estén desconectadas de las antiguas. Cuando un caso de abuso confirmado se propaga a cada identificador que tocó —cara, documento, teléfono, correo electrónico, dirección IP y dispositivo—, la siguiente cuenta creada con la misma infraestructura falla en la entrada en lugar de ser detectada 800 solicitudes después.
Mantiene la fricción alejada de los desarrolladores legítimos. Esta es la restricción que hace que todo el sistema sea viable. La verificación aplicada a todos es un impuesto al crecimiento. La verificación aplicada de forma adaptativa —por nivel de acceso, cuota, volumen de crédito, geografía o una alerta de comportamiento de la capa de tráfico— pone la fricción en el riesgo y deja el camino del desarrollador de confianza rápido.
Cuatro cosas. Ninguna de ellas es "previene la extracción". Las cuatro son reales.
Dónde encaja Didit
Didit es infraestructura para la identidad y el fraude, y las primitivas que componen una capa de acceso verificado son las que ya ofrecemos y publicamos precios:
- Verificación de identidad — documento de identidad, prueba de vida pasiva, coincidencia facial y análisis de IP, todo incluido por $0.33 por verificación, con 500 verificaciones KYC gratuitas al mes.
- Búsqueda Facial 1:N — búsqueda biométrica entre los usuarios verificados que su propia aplicación ha registrado, gratis con la verificación. Esta es la primitiva que vincula dos cuentas a una persona.
- Análisis de IP y Dispositivo — $0.03, e incluido en el paquete de $0.33. Emite
DUPLICATED_IP_ADDRESS,DUPLICATED_DEVICE_FINGERPRINT,DEVICE_RECOVERED_HIGH_CONFIDENCE,AUTOMATION_FRAMEWORK_DETECTEDy códigos relacionados. - API de Listas — listas de bloqueo para 12 tipos de entrada, donde el bloqueo de una sesión confirmada extrae automáticamente los identificadores que esa sesión capturó — cara, documento, teléfono, correo electrónico, IP y dispositivo.
- Autenticación Biométrica — $0.10 por reverificación sin contraseña, para vincular una acción privilegiada al humano que se registró en lugar de a un token de portador.
- Verificación de Negocios — desde $2.00 por empresa: consulta de registro, beneficiarios finales y directivos, con detección de entidades a $0.20 y cualquier verificación de identidad vinculada para un beneficiario final facturada a las tarifas estándar de Verificación de Usuario. Para acceso a nivel de organización e investigación.
Usted compone esas funciones en la política que su plataforma necesite. La composición es su arquitectura; las primitivas son las partes. Cada una se entrega a través de la API unificada /v3/ con un precio publicado y sin mínimos — algunas como su propio endpoint, como POST /v3/face-search/, y algunas a través de un flujo de sesión, como la autenticación biométrica, que no tiene un endpoint independiente propio.
Casos de uso
Proveedores de modelos frontera. Vincule el acceso de alto cupo, alto crédito y nivel de investigación a una persona o empresa verificada, dejando sin fricción los niveles gratuitos y de bajo volumen.
Plataformas de API de IA y proveedores de inferencia. Los revendedores y agregadores heredan el abuso sin heredar la pila de detección. Una capa de acceso es a menudo el único control que realmente poseen.
Productos de codificación de IA y agentes. El abuso de prueba y el "credit farming" utilizan la misma mecánica de multiplicación de cuentas que la destilación. Las mismas primitivas de vinculación abordan ambos.
Plataformas y mercados de IA en la nube. La verificación a nivel de organización responde a la pregunta "¿es esta una empresa real con beneficiarios reales?" antes de que se conceda una cuota empresarial.
Preguntas frecuentes
¿La verificación de identidad previene la destilación de modelos?
No. La extracción se previene —en la medida de lo posible— mediante controles de salida a nivel de modelo y detección de tráfico semántico. La identidad reduce el anonimato, vincula cuentas a través de una campaña y hace que las cuentas regeneradas fallen tempranamente. Es una capa de tres.
¿La verificación no ahuyentará a los desarrolladores legítimos?
Solo si la aplica a todos. El diseño que funciona es adaptativo: verifique según el riesgo, el nivel, la cuota, el volumen de crédito, la geografía o una alerta de comportamiento. La mayoría de los desarrolladores nunca deberían ver un paso de verificación. El KYC reutilizable de Didit es gratuito, por lo que un desarrollador ya verificado en otra parte de la red puede pasar una verificación sin volver a hacerla.
¿Puede Didit decirme si un flujo de solicitudes parece destilación?
No. Didit no ve sus prompts y no analiza la semántica de las solicitudes. Esa señal proviene de su propia capa de tráfico. Lo que Didit proporciona es la resolución de identidad para adjuntar esa alerta a un actor y las primitivas de aplicación para actuar en todas las cuentas conectadas a ellos.
¿Cuánto cuesta esto a la escala de una plataforma de IA?
La verificación se factura por verificación exitosa sin mínimos: $0.33 para el paquete completo de identidad, $0.03 solo para el análisis de IP y dispositivo, gratis para Búsqueda Facial 1:N, $0.10 para la reautenticación biométrica y desde $2.00 para la verificación de negocios. Debido a que la política es adaptativa, usted paga por la fracción de acceso que realmente justifica una verificación. Las primeras 500 verificaciones KYC cada mes son gratuitas.
Ya tenemos un proveedor de fraude. ¿Por qué esto es diferente?
La mayoría de las herramientas de fraude devuelven un veredicto por cuenta. El problema de la destilación es un problema por actor, y las primitivas que vinculan cuentas a un actor —búsqueda biométrica 1:N entre sus propios usuarios, correlación de dispositivos e IP, y propagación de listas de bloqueo a través de cada identificador de un único caso confirmado— son las cosas específicas que la puntuación por cuenta no hace.
¿Listo para empezar?
Comience con la primitiva que produce la señal de vinculación que le falta hoy.
- Lea la documentación — Búsqueda Facial 1:N, advertencias de Análisis de IP y Dispositivo, y la API de Listas.
- Vea el producto — Verificación de Usuario y Verificación de Negocios.
- Consulte los precios — cada módulo tiene precios públicos, pago por éxito, sin mínimos.
- Empiece gratis — cree una cuenta en business.didit.me y ejecute sus primeras 500 verificaciones KYC al mes sin coste.
Artículos relacionados
- Verificación de empresas para acceso a API de IA: ¿Quién controla realmente esta cuenta? (ES)
- Acceso Verificado a la API para Proveedores de Modelos de IA: Una Arquitectura de Riesgo por Niveles (ES)
- Búsqueda Facial 1:N: Encontrando Todas las Cuentas Controladas por una Persona (ES)
- Autenticación Biométrica Reforzada para Acceso a API de IA: Vinculando Privilegios a una Persona (ES)
- Redes de Cuentas Hydra: Cómo 20.000 Cuentas Se Convierten en un Solo Actor (ES)
- Propagación de Listas Negras: Cómo un Caso de Abuso Confirmado Puede Aniquilar Toda la Red (ES)