Passer au contenu principal
Didit lève 7,5 M$ pour bâtir l'infrastructure pour l'identité et la fraude
Didit
Retour au blog
Blog · 4 août 2026

Le guide pratique de la couche d'accès contre l'extraction de modèles (FR)

Le guide complet : ce que chaque couche de défense gère, les quatre primitives de la couche d'accès, la conception du déclenchement et de l'application, le modèle de coût, et les limites honnêtes de ce que l'identité peut faire.

Par DiditMis à jour le
ai-model-extraction-defense-playbook.png

Tout dans ce pilier s'assemble en une seule architecture. Voici cette architecture, présentée de manière compacte : ce que chaque couche gère, les primitives qui construisent la couche d'accès, comment les déclencheurs et l'application s'articulent, le coût, et les limites de son fonctionnement.

Si vous ne lisez qu'un seul article de cette série, lisez celui-ci. Si vous comptez construire la chose, lisez aussi les autres.

Points clés à retenir

  • Trois couches : contrôles de modèle, détection de trafic, accès vérifié. Vous possédez les deux premières. La troisième est composable à partir de primitives publiées et tarifées.
  • Quatre primitives de la couche d'accès : collecte (appareil et réseau), liaison (biométrique 1:N), association (vérification d'identité et d'entreprise), application (propagation de la liste noire).
  • Le niveau le moins cher fait le plus de travail. Collectez à 0,03 $ sur chaque compte payant — sans cela, toute investigation ultérieure est impossible.
  • Les déclencheurs doivent s'activer lors des transitions d'accès et des alertes comportementales, jamais sur une minuterie.
  • Coût réaliste pour une plateforme de 100 000 développeurs : environ 800 $ à 1 200 $ par mois, avec 500 vérifications KYC gratuites chaque mois.
  • La vérification d'identité n'empêche pas l'extraction de modèle. Elle augmente les coûts, réduit l'anonymat et raccourcit la durée de vie des comptes régénérés. Quiconque prétend plus que cela survend.

Couche un : ce que vous possédez déjà

Avant d'ajouter quoi que ce soit, soyez clair sur les deux couches qui sont les vôtres et le restent.

Contrôles de modèle — limiter les traces de raisonnement sensibles, façonner les sorties, restreindre ce qu'une réponse révèle sur la manière dont elle a été produite. Le rapport du Frontier Model Forum catalogue ce que l'attaquant recherche ici : exfiltration de la chaîne de pensée, critique de la chaîne de pensée, auto-évaluation de la chaîne de pensée, génération d'invites pour l'apprentissage par renforcement et génération de données synthétiques. Chacun d'eux cible ce que le modèle émet. Seul le fournisseur de modèle peut changer cela.

Détection de trafic — repérer les schémas de requêtes répétitifs, sémantiquement concentrés ou coordonnés. Cette couche progresse rapidement. Liu, Guo et Dong (arXiv 2606.05725) traitent la surveillance de l'extraction comme un test de distribution de fenêtre de trafic calibré de manière bénigne utilisant la divergence maximale de moyenne dans l'espace sémantique, et rapportent un taux de détection de 100 % pour les cas d'attaquant pur avec un taux de faux positifs de 0,3 % sur quatorze paires de requêtes attaquant-normal.

Aucun de ces problèmes n'est un problème d'identité, et aucun fournisseur d'identité ne devrait essayer de vous vendre l'un ou l'autre. Ce que l'infrastructure d'identité fait, c'est répondre à la question que ces couches soulèvent et ne peuvent résoudre : ce compte se comporte étrangement — combien d'autres comptes sont le même acteur, et que dois-je faire avec tous ?

Les quatre primitives

1. Collecter — 0,03 $, sur chaque compte payant

Exécutez l'analyse IP et de l'appareil sur chaque compte à votre niveau payant le moins cher. Non pas pour décider quoi que ce soit. Mais pour avoir les données.

Les codes que vous achetez sont DUPLICATED_DEVICE_FINGERPRINT, DUPLICATED_IP_ADDRESS, DEVICE_RECOVERED_HIGH_CONFIDENCE, AUTOMATION_FRAMEWORK_DETECTED, DEVICE_EMULATOR_DETECTED, DEVICE_ROOTED_OR_JAILBROKEN, DEVICE_RUNTIME_HOOKING_DETECTED, DEVICE_APP_TAMPERED et la famille de réseau.

C'est la décision la plus importante du guide et celle qui est le plus souvent ignorée, car le premier jour, elle ne semble rien faire. C'est un substrat de corrélation. Lorsque votre couche de trafic signale un compte au neuvième mois, la différence entre une interdiction d'un compte et un cluster de trente comptes dépend entièrement de si vous avez collecté au premier mois. Vous ne pouvez pas le rajouter après coup. Les sessions sont parties.

2. Lier — gratuit

La recherche faciale 1:N recherche un visage parmi toutes les vérifications approuvées que votre application a effectuées, renvoyant chaque correspondance avec vos propres vendor_data attachées. Gratuite avec la vérification Didit, en moins de deux secondes, et elle s'exécute automatiquement pendant la détection du vivant au sein d'une session de vérification.

C'est la primitive qui transforme les comptes en acteurs. Vingt mille comptes est un grand nombre. Vingt mille visages n'est pas une chose qu'un opérateur possède.

3. Associer — 0,33 $ individuel, à partir de 2,00 $ organisationnel

Vérification d'identité complète lors des transitions d'accès qui comportent un risque réel : augmentations de quota, octrois de crédit, émission de clés, mises à niveau de niveau de capacité. Document d'identité, détection passive du vivant, correspondance faciale et analyse IP à 0,33 $, avec les 500 premières vérifications gratuites chaque mois.

Pour les organisations, la recherche et les niveaux éducatifs — les catégories spécifiquement nommées par Anthropic dans « vérification renforcée pour les comptes éducatifs et de startup » — la vérification d'entreprise à partir de 2,00 $ résout le statut d'enregistrement, les bénéficiaires effectifs et les dirigeants, avec une vérification d'identité liée disponible pour chaque bénéficiaire effectif à partir de la même session.

La ré-authentification biométrique à 0,10 $ couvre le cas où le compte a été vérifié il y a longtemps et la question est de savoir si la même personne l'utilise toujours.

4. Appliquer — inclus

Lorsqu'un cas est confirmé, mettez en liste noire en utilisant reference_session_id et Didit extrait automatiquement l'identifiant correct de cette session — visage, document, téléphone, e-mail, IP ou appareil — à travers 12 types d'entrée, l'entrée étant liée à sa session source. Les entrées prennent effet immédiatement au moment de la vérification. ip_address accepte les plages CIDR lorsque les preuves pointent vers l'infrastructure.

Les listes blanches pour les mêmes 12 types maintiennent les partenaires de conception et les équipes d'ingénierie d'entreprise hors de toute voie d'escalade, ce qui rend une politique stricte supportable.

La conception du déclencheur

Les primitives sans déclencheurs sont un centre de coûts. Les règles qui tiennent la route :

Déclencher lors des transitions d'accès. Augmentation de quota, octroi de crédit, nouvelle clé API, mise à niveau de niveau, nouveau membre d'équipe privilégié, changement de propriétaire de facturation.

Déclencher sur vos propres alertes comportementales. C'est le déclencheur le plus précieux dans la conception, et c'est le point d'intégration entre les couches. Votre détection sémantique produit un signal que l'infrastructure d'identité ne peut pas ; l'identité produit la résolution et l'application qu'un classificateur sémantique ne peut pas. Ni l'un ni l'autre ne se substitue à l'autre.

Déclencher sur les signaux de liaison. DEVICE_RECOVERED_HIGH_CONFIDENCE sur un nouveau compte, ou un visage correspondant à un utilisateur vérifié existant, justifie une vérification supplémentaire, quelle que soit la demande.

Ne pas déclencher sur une minuterie. La revérification périodique de tout le monde coûte proportionnellement à votre base d'utilisateurs et ne protège proportionnellement à rien.

Ne pas déclencher à l'inscription. Laissez les gens s'inscrire, lire la documentation, obtenir une clé et faire de vrais appels. La vérification à l'inscription convertit le moins bien et protège le moins.

Le modèle de coût

Prenons une plateforme avec 100 000 développeurs enregistrés et une distribution illustrative :

NiveauComptesVérificationUnitéMensuel
Gratuit85 000aucun0 $0 $
Payant en libre-service12 000IP + appareil0,03 $360 $ une seule fois, puis uniquement les nouveaux comptes
Quota élevé / crédit2 500bundle complet0,33 $825 $ une seule fois, puis uniquement les nouveaux comptes
Organisation / recherche500vérification d'entrepriseà partir de 2,00 $1 000 $ une seule fois, puis uniquement les nouveaux comptes
Augmentation sur alertes~200 / moisauthentification biométrique0,10 $20 $

Les colonnes « une seule fois » sont importantes : la vérification est par compte, pas par mois. Le coût en régime permanent estR déterminé par les nouveaux comptes entrant dans chaque niveau, plus les augmentations déclenchées par les alertes — pour la plupart des plateformes, environ 800 $ à 1 200 $ par mois à cette échelle. Les 500 premières vérifications KYC chaque mois sont gratuites, tout est payant par succès, et il n'y a pas de minimums ni de licences par siège.

Comparez cela aux campagnes mesurées par Anthropic — plus de 16 millions d'échanges via environ 24 000 comptes frauduleux. Le coût d'inférence de 16 millions d'échanges n'est pas un chiffre de quelques centaines de dollars.

Votre distribution différera du tableau. La conclusion structurelle non : la vérification coûteuse s'applique au moins grand nombre de comptes, et la vérification qui s'applique au plus grand nombre de comptes est gratuite.

L'ordre d'implémentation

  1. Collectez d'abord. Analyse IP et de l'appareil sur chaque compte payant. Faites cela avant toute autre chose, car c'est la seule étape qui devient plus difficile plus vous attendez.
  2. Instrumentez, n'appliquez pas. Exécutez pendant un mois et regardez ce que les codes disent réellement de votre population. La base de référence de chaque plateforme est différente et l'application contre une base de référence supposée génère des faux positifs.
  3. Câblez le chemin d'alerte. Connectez vos alertes de couche de trafic à un déclencheur de vérification. C'est l'intégration qui valorise davantage les deux couches.
  4. Ajoutez la liaison aux niveaux supérieurs. Vérification complète sur les quotas élevés et l'escalade de crédit ; vérification d'entreprise sur les niveaux organisationnels et de recherche.
  5. Établissez le manuel d'application. Résolvez d'abord le cluster, puis mettez en liste noire à partir de la session confirmée pour chaque type d'entrée, puis vérifiez que l'application a été effectuée. Appliquer avant de résoudre bannit un compte et avertit l'opérateur.
  6. Autorisez vos amis. Avant de resserrer quoi que ce soit, excluez explicitement les partenaires de conception et les équipes d'ingénierie d'entreprise.

Là où cela cesse de fonctionner

Un guide honnête énonce ses propres limites.

Il ne détecte pas l'extraction. L'infrastructure d'identité ne voit jamais vos invites. Si votre couche de trafic est faible, la couche d'accès ne compensera pas — elle résoudra fidèlement les acteurs que vous n'avez jamais signalés.

Un opérateur déterminé et bien financé peut toujours s'introduire. Payer de vraies personnes avec de vrais documents sur de vrais appareils pour ouvrir des comptes déjoue tous les contrôles d'identité, car les comptes sont véritablement distincts. Ce que cela change, c'est le prix. L'agriculture de comptes qui coûtait à peu près rien coûte maintenant le recrutement, la coordination et les frais généraux par personne — et le réseau résultant est plus petit et plus lent à se régénérer.

Chaque couche produit des faux positifs. Les bureaux partagés produisent DUPLICATED_IP_ADDRESS. Les familles partagent des appareils. Les développeurs détiennent légitimement deux comptes. C'est pourquoi les signaux dupliqués sont informatifs par défaut et pourquoi la politique vous appartient.

La vérification a une réelle friction et un coût réel pour votre entonnoir. La hiérarchisation existe pour les éloigner des personnes qui ne devraient jamais les rencontrer, mais l'effet n'est pas nul. Mesurez-le.

C'est une fonction de coût, pas un mur. Le succès n'est pas « l'extraction est devenue impossible ». Le succès est qu'une campagne nécessitant 20 000 comptes nécessite désormais 20 000 identités vérifiées, que chaque suppression coûte à l'opérateur plus qu'une adresse e-mail à remplacer, et qu'un seul cas confirmé se propage à tout ce qu'il a touché.

Questions fréquemment posées

Quelle est la chose la plus efficace à faire en premier ?

Collectez les signaux d'appareil et de réseau sur chaque compte payant à 0,03 $. Cela ne semble rien faire le premier jour, et c'est la raison pour laquelle toute enquête ultérieure est possible. On ne peut pas le rajouter après coup.

Avons-nous besoin des quatre primitives ?

Non. Collecter et lier vous apportent la majeure partie de la valeur analytique. Lier et appliquer sont ce qui vous permet d'agir. Commencez par collecter.

Comment cela interagit-il avec un classificateur de détection que nous exécutons déjà ?

Ils se composent. Votre classificateur dit ce compte fait quelque chose de mal. La liaison faciale, d'appareil et de réseau dit ce sont trente comptes, pas un. La propagation de la liste noire fait en sorte que la réponse les couvre tous. Aucune des couches ne fait le travail de l'autre.

Didit est-il déployé chez les entreprises d'IA de pointe ?

Nous ne discutons pas de qui utilise Didit. Tout ce qui est décrit ici est construit à partir de primitives documentées et tarifées publiquement que toute équipe peut évaluer par rapport à son architecture, en commençant par 500 vérifications KYC gratuites par mois.

Qu'en est-il de la vérification des agents IA plutôt que des humains ?

L'identité des agents est un problème réel et non résolu, et le serveur MCP de Didit est en ligne et gratuit. Mais les campagnes d'extraction mesurées à ce jour s'exécutent sur des comptes enregistrés par des humains à grande échelle, ce qui est le problème que ce guide aborde.

Est-ce que tout cela arrête complètement la distillation ?

Non. Les contrôles de sortie au niveau du modèle et la détection sémantique du trafic restent nécessaires et sont la propriété du fournisseur de modèle. La couche d'accès réduit l'anonymat, résout les acteurs à travers les comptes, augmente le coût de la régénération et donne à vos alertes existantes quelque chose sur quoi agir. C'est l'affirmation, et c'est toute l'affirmation.

Prêt à commencer ?

Construisez la couche d'accès à partir de primitives que vous pouvez évaluer avant de vous engager envers l'une d'entre elles.

Infrastructure pour l'identité et la fraude.

Une seule API pour le KYC, le KYB, la surveillance des transactions et le screening de portefeuilles. Intégration en 5 minutes.

Demande à une IA de résumer cette page
Guide de la couche d'accès contre l'extraction de modèles | Didit.