Zum Hauptinhalt springen
Didit erhält 7,5 Mio. $ für die Infrastruktur für Identität und Betrug
Didit
Zurück zum Blog
Blog · 4. August 2026

Das Playbook für die Zugriffsebene gegen Modell-Extraktion (DE)

Das zusammengestellte Playbook: Was jede der drei Verteidigungsebenen beinhaltet, die vier Grundelemente, die die Zugriffsebene bilden, das Design von Auslösern und Durchsetzung, das Kostenmodell und die ehrlichen Grenzen.

Von DiditAktualisiert
ai-model-extraction-defense-playbook.png

Alles in diesem Pfeiler fügt sich zu einer Architektur zusammen. Dies ist diese Architektur, kompakt dargestellt – was jede Ebene besitzt, welche Grundelemente die Zugriffsebene bilden, wie die Auslöser und die Durchsetzung zusammenpassen, was es kostet und wo es aufhört zu funktionieren.

Wenn Sie einen Beitrag in dieser Reihe lesen, lesen Sie diesen. Wenn Sie das Ding bauen wollen, lesen Sie auch die anderen.

Wichtige Erkenntnisse

  • Drei Ebenen: Modellkontrollen, Verkehrserkennung, verifizierter Zugang. Die ersten beiden gehören Ihnen. Die dritte ist aus veröffentlichten, bepreisten Grundelementen zusammensetzbar.
  • Vier Grundelemente der Zugriffsebene: Sammeln (Gerät und Netzwerk), Verknüpfen (biometrisch 1:N), Binden (Identitäts- und Unternehmensverifizierung), Durchsetzen (Blocklisten-Propagierung).
  • Die günstigste Stufe leistet die meiste Arbeit. Sammeln Sie für 0,03 $ bei jedem zahlenden Konto – ohne dies ist jede spätere Untersuchung unmöglich.
  • Auslöser sollten bei Zugangsübergängen und Verhaltensalarmen auslösen, niemals nach einem Timer.
  • Realistische Kosten für eine Plattform mit 100.000 Entwicklern: ungefähr 800–1.200 $ pro Monat, mit 500 kostenlosen KYC-Verifizierungen pro Monat.
  • Identitätsverifizierung verhindert keine Modell-Extraktion. Sie erhöht die Kosten, reduziert die Anonymität und verkürzt die Lebensdauer regenerierter Konten. Wer mehr behauptet, übertreibt.
  • Ebene eins: Was Sie bereits besitzen

    Bevor Sie etwas hinzufügen, machen Sie sich klar, welche beiden Ebenen Ihnen gehören und Ihnen bleiben.

    Modellkontrollen – Begrenzung sensibler Schlussfolgerungspfade, Gestaltung der Ausgaben, Einschränkung dessen, was eine Antwort darüber verrät, wie sie erzeugt wurde. Das Issue Brief des Frontier Model Forum katalogisiert, worauf der Angreifer hier abzielt: Exfiltration von Gedankengängen, Kritik von Gedankengängen, automatische Bewertung von Gedankengängen, Prompt-Generierung für Reinforcement Learning und Generierung synthetischer Daten. Jedes davon zielt auf das ab, was das Modell ausgibt. Nur der Modell-Anbieter kann das ändern.

    Verkehrserkennung – Erkennung repetitiver, semantisch konzentrierter oder koordinierter Anfragemuster. Diese Ebene entwickelt sich schnell weiter. Liu, Guo und Dong (arXiv 2606.05725) behandeln die Extraktionsüberwachung als gutmütig kalibrierten Traffic-Window-Verteilungstest unter Verwendung der maximalen mittleren Diskrepanz im semantischen Raum und berichten eine 100%ige Erkennungsrate für reine Angreiferfälle bei einer Falsch-Positiv-Rate von 0,3% über vierzehn Angreifer-Normal-Abfragepaare.

    Keines davon ist ein Identitätsproblem, und kein Identitätsanbieter sollte versuchen, Ihnen eines davon zu verkaufen. Was die Identitätsinfrastruktur leistet, ist die Beantwortung der Frage, die diese Ebenen aufwerfen und nicht lösen können: Dieses Konto verhält sich seltsam – wie viele andere Konten gehören demselben Akteur, und was mache ich mit all diesen?

    Die vier Grundelemente

    1. Sammeln – 0,03 $, bei jedem zahlenden Konto

    Führen Sie eine IP- und Geräteanalyse für jedes Konto in Ihrer günstigsten kostenpflichtigen Stufe durch. Nicht um etwas zu entscheiden. Sondern um die Daten zu haben.

    Die Codes, die Sie kaufen, sind DUPLICATED_DEVICE_FINGERPRINT, DUPLICATED_IP_ADDRESS, DEVICE_RECOVERED_HIGH_CONFIDENCE, AUTOMATION_FRAMEWORK_DETECTED, DEVICE_EMULATOR_DETECTED, DEVICE_ROOTED_OR_JAILBROKEN, DEVICE_RUNTIME_HOOKING_DETECTED, DEVICE_APP_TAMPERED und die Netzwerkfamilie.

    Dies ist die Entscheidung mit dem größten Hebel im Playbook und die am häufigsten übersprungene, da sie am ersten Tag scheinbar nichts bewirkt. Sie ist ein Korrelationssubstrat. Wenn Ihre Verkehrsebene im neunten Monat ein Konto kennzeichnet, liegt der Unterschied zwischen einer Kontosperre und einem Cluster von dreißig Konten ausschließlich daran, ob Sie im ersten Monat gesammelt haben. Sie können dies nicht nachträglich einrichten. Die Sitzungen sind verloren.

    2. Verknüpfen – kostenlos

    Face Search 1:N durchsucht ein Gesicht über jede genehmigte Verifizierung, die Ihre Anwendung durchgeführt hat, und gibt jede Übereinstimmung mit Ihren eigenen vendor_data zurück. Kostenlos mit Didit-Verifizierung, unter zwei Sekunden, und es läuft automatisch während der Liveness innerhalb einer Verifizierungssitzung.

    Dies ist das Grundelement, das Konten zu Akteuren macht. Zwanzigtausend Konten ist eine große Zahl. Zwanzigtausend Gesichter ist nichts, was ein Operator hat.

    3. Binden – 0,33 $ für Einzelpersonen, ab 2,00 $ für Organisationen

    Vollständige Identitätsverifizierung bei Zugangsübergängen, die ein echtes Risiko bergen: Quotenerhöhungen, Kreditvergaben, Schlüsselausgabe, Upgrade von Leistungsstufen. ID-Dokument, passive Liveness, Gesichtsabgleich und IP-Analyse für 0,33 $, wobei die ersten 500 pro Monat kostenlos sind.

    Für Organisationen, Forschungs- und Bildungseinrichtungen – die Kategorien, die Anthropic ausdrücklich in „verstärkte Verifizierung für Bildungs- und Startup-Konten“ genannt hat – löst die Unternehmensverifizierung ab 2,00 $ den Registrierungsstatus, die wirtschaftlich Berechtigten und leitenden Angestellten, mit verknüpfter Identitätsverifizierung, die für jeden wirtschaftlich Berechtigten aus derselben Sitzung verfügbar ist.

    Biometrische Re-Authentifizierung für 0,10 $ deckt den Fall ab, dass das Konto vor langer Zeit verifiziert wurde und die Frage ist, ob derselbe Mensch es immer noch bedient.

    4. Durchsetzen – inklusive

    Wenn ein Fall bestätigt wird, wird eine Blockliste mit reference_session_id verwendet und Didit extrahiert automatisch den richtigen Bezeichner aus dieser Sitzung – Gesicht, Dokument, Telefon, E-Mail, IP oder Gerät – über 12 Eingabetypen hinweg, wobei der Eintrag mit seiner Quellsitzung verknüpft ist. Einträge werden sofort zum Zeitpunkt der Verifizierung wirksam. ip_address akzeptiert CIDR-Bereiche, wenn die Beweise auf Infrastruktur hinweisen.

    Zulassungslisten über dieselben 12 Typen halten Designpartner und Engineering-Teams von Unternehmen von jedem Eskalationspfad fern, was eine strikte Richtlinie überlebensfähig macht.

    Das Trigger-Design

    Grundelemente ohne Auslöser sind ein Kostenfaktor. Die Regeln, die Bestand haben:

    Auslösen bei Zugangsübergängen. Quotenerhöhung, Kreditvergabe, neuer API-Schlüssel, Stufen-Upgrade, neues privilegiertes Teammitglied, Änderung des Rechnungsinhabers.

    Auslösen bei Ihren eigenen Verhaltensalarmen. Dies ist der wertvollste Auslöser im Design und die Integrationsstelle zwischen den Ebenen. Ihre semantische Erkennung erzeugt ein Signal, das die Identitätsinfrastruktur nicht kann; die Identität erzeugt die Auflösung und Durchsetzung, die ein semantischer Klassifikator nicht kann. Keines ersetzt das andere.

    Auslösen bei Verknüpfungssignalen. DEVICE_RECOVERED_HIGH_CONFIDENCE bei einem neuen Konto oder ein Gesicht, das mit einem bestehenden verifizierten Benutzer übereinstimmt, führt zu einer Eskalation, unabhängig davon, was angefordert wird.

    Nicht nach einem Timer auslösen. Eine periodische Neuverifizierung aller Benutzer kostet proportional zu Ihrer Benutzerbasis und schützt proportional zu nichts.

    Nicht bei der Registrierung auslösen. Lassen Sie die Leute sich anmelden, die Dokumente lesen, einen Schlüssel erhalten und echte Anrufe tätigen. Die Verifizierung bei der Registrierung konvertiert am schlechtesten und schützt am wenigsten.

    Das Kostenmodell

    Nehmen Sie eine Plattform mit 100.000 registrierten Entwicklern und einer beispielhaften Verteilung:

    StufeKontenPrüfungEinheitMonatlich
    Kostenlos85.000keine0 $0 $
    Bezahlter Self-Service12.000IP + Gerät0,03 $360 $ einmalig, dann nur neue Konten
    Hohe Quote / Kredit2.500volles Paket0,33 $825 $ einmalig, dann nur neue Konten
    Organisation / Forschung500Unternehmensverifizierungab 2,00 $1.000 $ einmalig, dann nur neue Konten
    Eskalation bei Alarmen~200 / Monatbiometrische Authentifizierung0,10 $20 $

    Die einmaligen Spalten sind wichtig: Die Verifizierung erfolgt pro Konto, nicht pro Monat. Die konstanten Kosten werden durch neue Konten in jeder Stufe sowie durch alarmgesteuerte Eskalationen bestimmt – für die meisten Plattformen etwa 800 bis 1.200 $ pro Monat in dieser Größenordnung. Die ersten 500 KYC-Verifizierungen pro Monat sind kostenlos, alles ist Pay-per-Success, und es gibt keine Mindestmengen oder Lizenzgebühren.

    Vergleichen Sie dies mit den von Anthropic gemessenen Kampagnen – über 16 Millionen Austauschvorgänge durch etwa 24.000 betrügerische Konten. Die Inferenzkosten von 16 Millionen Austauschvorgängen sind keine Zahl im Hunderterbereich.

    Ihre Verteilung wird von der Tabelle abweichen. Die strukturelle Schlussfolgerung jedoch nicht: Die teure Prüfung gilt für die wenigsten Konten, und die Prüfung, die für die meisten Konten gilt, ist kostenlos.

    Die Implementierungsreihenfolge

    1. Zuerst sammeln. IP- und Geräteanalyse für jedes zahlende Konto. Tun Sie dies vor allem anderen, denn dies ist der einzige Schritt, der umso schwieriger wird, je länger Sie warten.
    2. Instrumentieren, nicht durchsetzen. Einen Monat lang laufen lassen und schauen, was die Codes tatsächlich über Ihre Population aussagen. Die Basislinie jeder Plattform ist anders, und die Durchsetzung gegen eine angenommene Basislinie erzeugt Fehlalarme.
    3. Den Alarmpfad verdrahten. Verbinden Sie Ihre Verkehrs-Layer-Alarme mit einem Verifizierungs-Trigger. Dies ist die Integration, die beide Layer wertvoller macht.
    4. Bindung auf den oberen Ebenen hinzufügen. Vollständige Verifizierung bei hoher Quote und Krediteskalation; Unternehmensverifizierung auf Organisations- und Forschungsebenen.
    5. Das Durchsetzungs-Runbook erstellen. Zuerst den Cluster auflösen, dann aus der bestätigten Sitzung über jeden Eingabetyp hinweg auf die Blockliste setzen, dann überprüfen, ob die Durchsetzung erfolgt ist. Das Durchsetzen vor der Auflösung sperrt ein Konto und warnt den Betreiber.
    6. Ihre Freunde auf die Zulassungsliste setzen. Bevor Sie etwas verschärfen, nehmen Sie Designpartner und Engineering-Teams von Unternehmen explizit aus.

    Wo dies aufhört zu funktionieren

    Ein ehrliches Playbook nennt seine eigenen Grenzen.

    Es erkennt keine Extraktion. Die Identitätsinfrastruktur sieht Ihre Prompts nie. Wenn Ihre Verkehrsebene schwach ist, wird die Zugriffsebene dies nicht kompensieren – sie wird Akteure, die Sie nie markiert haben, getreu auflösen.

    Ein entschlossener, gut finanzierter Akteur kann immer noch eindringen. Die Bezahlung echter Personen mit echten Dokumenten auf echten Geräten zum Öffnen von Konten überwindet jede Identitätskontrolle, da die Konten tatsächlich unterschiedlich sind. Was sich dadurch ändert, ist der Preis. Kontenfarming, das ungefähr nichts kostete, kostet jetzt Rekrutierung, Koordination und pro-Person-Overhead – und das resultierende Netzwerk ist kleiner und langsamer zu regenerieren.

    Jede Ebene erzeugt Fehlalarme. Gemeinsame Büros erzeugen DUPLICATED_IP_ADDRESS. Familien teilen sich Geräte. Entwickler besitzen legitim zwei Konten. Deshalb sind doppelte Signale standardmäßig informativ und die Richtlinie liegt bei Ihnen.

    Die Verifizierung hat echte Reibung und echte Kosten für Ihren Funnel. Die Staffelung existiert, um beides von den Personen fernzuhalten, die niemals damit in Berührung kommen sollten, aber der Effekt ist nicht null. Messen Sie es.

    Es ist eine Kostenfunktion, keine Wand. Erfolg bedeutet nicht, dass „Extraktion unmöglich wurde“. Erfolg bedeutet, dass eine Kampagne, die 20.000 Konten erforderte, jetzt 20.000 verifizierte Identitäten erfordert, dass jede Entfernung den Betreiber mehr kostet als eine E-Mail-Adresse zum Ersetzen, und dass ein einziger bestätigter Fall sich über alles ausbreitet, was er berührt hat.

    Häufig gestellte Fragen

    Was ist das Wichtigste, was man zuerst tun sollte?

    Sammeln Sie Geräte- und Netzwerksignale für jedes zahlende Konto für 0,03 $. Es sieht am ersten Tag so aus, als würde es nichts bewirken, und es ist der Grund, warum jede spätere Untersuchung möglich ist. Es kann nicht nachträglich eingerichtet werden.

    Benötigen wir alle vier Grundelemente?

    Nein. Sammeln und Verknüpfen bringen Ihnen den größten Teil des Analysewerts. Binden und Durchsetzen ermöglichen es Ihnen, darauf zu reagieren. Beginnen Sie mit dem Sammeln.

    Wie interagiert dies mit einem Erkennungsklassifikator, den wir bereits betreiben?

    Sie ergänzen sich. Ihr Klassifikator sagt: Dieses Konto tut etwas Falsches. Gesichts-, Geräte- und Netzwerkverknüpfung sagen: Dies sind dreißig Konten, nicht eines. Die Blocklisten-Propagierung sorgt dafür, dass die Reaktion alle betrifft. Keine Ebene übernimmt die Aufgabe der anderen.

    Wird Didit bei führenden KI-Unternehmen eingesetzt?

    Wir erörtern nicht, wer Didit nutzt. Alles hier Beschriebene basiert auf dokumentierten, öffentlich bepreisten Grundelementen, die jedes Team anhand seiner eigenen Architektur bewerten kann, beginnend mit 500 kostenlosen KYC-Verifizierungen pro Monat.

    Was ist mit der Verifizierung von KI-Agenten statt Menschen?

    Die Identität von Agenten ist ein echtes und ungelöstes Problem, und Didits MCP-Server ist live und kostenlos. Aber die bisher gemessenen Extraktionskampagnen laufen auf menschlich registrierten Konten in großem Maßstab, was das Problem ist, das dieses Playbook angeht.

    Stoppt irgendetwas davon die Destillation gänzlich?

    Nein. Modell-basierte Ausgabekontrollen und semantische Verkehrserkennung bleiben notwendig und liegen in der Verantwortung des Modell-Anbieters. Die Zugriffsebene reduziert die Anonymität, löst Akteure über Konten hinweg auf, erhöht die Kosten der Regeneration und gibt Ihren bestehenden Alarmen etwas, worauf sie reagieren können. Das ist die Behauptung, und es ist die ganze Behauptung.

    Bereit zum Start?

    Bauen Sie die Zugriffsebene aus Grundelementen, deren Preise Sie kennen, bevor Sie sich auf eines davon festlegen.

Infrastruktur für Identität und Betrugsprävention.

Eine API für KYC, KYB, Transaktionsüberwachung und Wallet-Screening. In 5 Minuten integriert.

Lass dir diese Seite von einer KI zusammenfassen
Zugriffsebenen-Playbook gegen Modell-Extraktion | Didit.