본문으로 건너뛰기
Didit, 신원·사기 방지 인프라 구축 위해 750만 달러 투자 유치
Didit
블로그로 돌아가기
블로그 · 2026년 8월 4일

모델 추출 방어를 위한 액세스 레이어 전략집 (KO)

모델 추출 방어를 위한 통합 전략: 세 가지 방어 레이어의 역할, 액세스 레이어를 구성하는 네 가지 기본 요소, 트리거 및 강제 적용 설계, 비용 모델, 그리고 신원 확인의 현실적인 한계에 대한 내용입니다.

작성자: Didit업데이트됨
ai-model-extraction-defense-playbook.png

이 기둥의 모든 내용은 하나의 아키텍처로 통합됩니다. 다음은 그 아키텍처를 간결하게 설명한 것입니다. 각 레이어가 소유한 것, 액세스 레이어를 구축하는 기본 요소, 트리거와 강제 적용이 어떻게 결합되는지, 비용은 얼마인지, 그리고 작동을 멈추는 지점은 어디인지에 대한 내용입니다.

이 시리즈에서 단 하나의 게시물만 읽는다면, 이 게시물을 읽으십시오. 직접 구축할 계획이라면 다른 게시물도 읽으십시오.

핵심 요약

  • 세 가지 레이어: 모델 제어, 트래픽 감지, 검증된 액세스. 처음 두 가지는 귀하의 소유입니다. 세 번째는 게시된 가격이 책정된 기본 요소로 구성할 수 있습니다.
  • 네 가지 액세스 레이어 기본 요소: 수집(장치 및 네트워크), 연결(생체 인식 1:N), 바인딩(신원 및 비즈니스 확인), 강제 적용(차단 목록 전파).
  • 가장 저렴한 계층이 가장 많은 작업을 수행합니다. 모든 유료 계정에 대해 $0.03로 수집 — 이것이 없으면 모든 후속 조사가 불가능합니다.
  • 트리거는 타이머가 아닌 액세스 전환 및 행동 경고에 따라 작동해야 합니다.
  • 개발자 10만 명 규모의 플랫폼에 대한 현실적인 비용: 매월 500건의 무료 KYC 확인을 포함하여 대략 월 $800~$1,200.
  • 신원 확인은 모델 추출을 방지하지 않습니다. 비용을 증가시키고 익명성을 감소시키며 재생성된 계정의 수명을 단축시킵니다. 그 이상을 주장하는 사람은 과장하고 있는 것입니다.

첫 번째 레이어: 이미 소유하고 있는 것

어떤 것을 추가하기 전에, 귀하의 소유이며 계속 귀하의 소유인 두 가지 레이어에 대해 명확히 하십시오.

모델 제어 — 민감한 추론 추적 제한, 출력 형태 지정, 응답이 생성 방식을 드러내는 것 제한. Frontier Model Forum의 이슈 브리프는 공격자가 여기에서 무엇을 노리는지 분류합니다. 사고 연쇄 유출, 사고 연쇄 비판, 사고 연쇄 자동 채점, 강화 학습을 위한 프롬프트 생성, 합성 데이터 생성. 이 모든 것은 모델이 내보내는 것을 목표로 합니다. 오직 모델 제공자만이 이를 변경할 수 있습니다.

트래픽 감지 — 반복적이고 의미론적으로 집중되거나 조정된 요청 패턴을 감지합니다. 이 레이어는 빠르게 발전하고 있습니다. Liu, Guo 및 Dong(arXiv 2606.05725)은 추출 모니터링을 의미 공간에서 최대 평균 불일치를 사용하는 양성 보정 트래픽 창 분포 테스트로 처리하며, 14개의 공격자-정상 쿼리 쌍에서 0.3%의 오탐율로 순수 공격자 사례에 대해 100%의 탐지율을 보고합니다.

이들 중 어느 것도 신원 문제에 해당하지 않으며, 어떤 신원 공급업체도 이들 중 어느 하나를 판매하려고 시도해서는 안 됩니다. 신원 인프라가 하는 일은 이러한 레이어가 제기하고 해결할 수 없는 질문에 답하는 것입니다. 이 계정이 이상하게 작동하고 있습니다. 몇 개의 다른 계정이 동일한 행위자이며, 이 모든 계정에 대해 어떻게 해야 합니까?

네 가지 기본 요소

1. 수집 — $0.03, 모든 유료 계정에서

가장 저렴한 유료 계층의 모든 계정에 대해 IP 및 장치 분석을 실행하십시오. 어떤 것도 결정하기 위함이 아닙니다. 데이터를 확보하기 위함입니다.

구매하는 코드는 DUPLICATED_DEVICE_FINGERPRINT, DUPLICATED_IP_ADDRESS, DEVICE_RECOVERED_HIGH_CONFIDENCE, AUTOMATION_FRAMEWORK_DETECTED, DEVICE_EMULATOR_DETECTED, DEVICE_ROOTED_OR_JAILBROKEN, DEVICE_RUNTIME_HOOKING_DETECTED, DEVICE_APP_TAMPERED 및 네트워크 제품군입니다.

이것은 전략집에서 가장 영향력 있는 결정이며 가장 자주 건너뛰는 결정입니다. 왜냐하면 첫날에는 아무것도 하지 않는 것처럼 보이기 때문입니다. 이것은 상관관계 기판입니다. 9개월째에 트래픽 계층에서 계정을 플래그 지정할 때, 한 계정 차단과 30개 계정 클러스터 간의 차이는 1개월째에 수집했는지 여부에 전적으로 달려 있습니다. 이것은 소급 적용할 수 없습니다. 세션은 사라집니다.

2. 연결 — 무료

Face Search 1:N은 애플리케이션이 수행한 모든 승인된 확인에서 얼굴을 검색하여, 각 일치 항목을 귀하의 vendor_data와 함께 반환합니다. Didit 확인과 함께 무료이며, 2초 미만으로, 확인 세션 내에서 활성 상태 동안 자동으로 실행됩니다.

이것은 계정을 행위자로 만드는 기본 요소입니다. 2만 개의 계정은 많은 수입니다. 2만 개의 얼굴은 운영자가 가지고 있는 것이 아닙니다.

3. 바인딩 — 개인 $0.33, 조직 $2.00부터

실질적인 위험이 수반되는 액세스 전환 시 전체 신원 확인: 할당량 증가, 신용 부여, 키 발급, 기능 계층 업그레이드. ID 문서, 비활성 생체 인식, 얼굴 일치 및 IP 분석이 $0.33이며, 매월 첫 500건은 무료입니다.

조직, 연구 및 교육 계층의 경우 — Anthropic이 "교육 및 스타트업 계정에 대한 강화된 확인"에서 구체적으로 언급한 범주 — $2.00부터의 비즈니스 확인은 등록 상태, 실제 소유자 및 임원을 해결하며, 동일한 세션에서 각 실제 소유자에 대해 연결된 신원 확인을 사용할 수 있습니다.

$0.10의 생체 인식 재인증은 계정이 오래 전에 확인되었고 동일한 사람이 여전히 계정을 운영하고 있는지 여부가 문제인 경우를 다룹니다.

4. 강제 적용 — 포함

사례가 확인되면, reference_session_id를 사용하여 차단 목록에 추가하고 Didit은 해당 세션에서 얼굴, 문서, 전화, 이메일, IP 또는 장치 등 12가지 항목 유형에 걸쳐 올바른 식별자를 자동으로 추출하며, 해당 항목은 원래 세션에 다시 연결됩니다. 항목은 확인 시 즉시 적용됩니다. 증거가 인프라를 가리킬 때 ip_address는 CIDR 범위를 허용합니다.

동일한 12가지 유형에 걸친 허용 목록은 설계 파트너 및 기업 엔지니어링 팀을 모든 에스컬레이션 경로에서 제외시켜 엄격한 정책이 유지될 수 있도록 합니다.

트리거 설계

트리거 없는 기본 요소는 비용 센터입니다. 유지되는 규칙은 다음과 같습니다.

액세스 전환 시 작동. 할당량 증가, 신용 부여, 새 API 키, 계층 업그레이드, 새 특권 팀원, 청구 소유자 변경.

자체 행동 경고 시 작동. 이것은 설계에서 가장 가치 있는 트리거이며, 레이어 간의 통합 지점입니다. 귀하의 의미 감지는 신원 인프라가 할 수 없는 신호를 생성합니다. 신원은 의미 분류기가 할 수 없는 해결 및 강제 적용을 생성합니다. 어느 쪽도 다른 쪽을 대체할 수 없습니다.

연결 신호 시 작동. 새 계정에서 DEVICE_RECOVERED_HIGH_CONFIDENCE 또는 기존 확인된 사용자와 일치하는 얼굴은 요청되는 내용에 관계없이 단계별 상승을 얻습니다.

타이머에 따라 작동하지 않음. 모든 사람에 대한 주기적인 재확인은 사용자 기반에 비례하여 비용이 들고 아무것도 보호하지 않습니다.

가입 시 작동하지 않음. 사람들이 가입하고, 문서를 읽고, 키를 얻고 실제 호출을 하도록 허용하십시오. 가입 시 확인은 가장 전환율이 낮고 가장 적게 보호합니다.

비용 모델

등록된 개발자 10만 명과 예시적인 분포를 가진 플랫폼을 가정합니다.

계층계정확인단위월별
무료85,000없음$0$0
유료 셀프 서비스12,000IP + 장치$0.03$360 일회성, 이후 신규 계정만 해당
높은 할당량 / 신용2,500전체 번들$0.33$825 일회성, 이후 신규 계정만 해당
조직 / 연구500비즈니스 확인$2.00부터$1,000 일회성, 이후 신규 계정만 해당
경고 시 단계별 상승~월 200건생체 인식 인증$0.10$20

일회성 열이 중요합니다. 확인은 월별이 아니라 계정당입니다. 정상 상태 비용은 각 계층에 진입하는 새로운 계정 및 경고 기반의 단계별 상승으로 인해 발생합니다. 대부분의 플랫폼에서 이 규모에서 월 약 $800~$1,200입니다. 매월 첫 500건의 KYC 확인은 무료이며, 모든 것은 성공당 지불 방식이며, 최소 금액이나 좌석 라이선스가 없습니다.

Anthropic이 측정한 캠페인과 비교해 보면, 약 24,000개의 사기 계정을 통해 1,600만 건 이상의 교환이 있었습니다. 1,600만 건의 교환에 대한 추론 비용은 수백 달러 수준이 아닙니다.

귀하의 분포는 표와 다를 수 있습니다. 구조적 결론은 동일합니다. 비싼 확인은 가장 적은 수의 계정에 적용되며, 가장 많은 계정에 적용되는 확인은 무료입니다.

구현 순서

  1. 먼저 수집. 모든 유료 계정에 대한 IP 및 장치 분석. 다른 어떤 것보다 먼저 이것을 하십시오. 기다릴수록 어려워지는 유일한 단계이기 때문입니다.
  2. 측정, 강제 적용하지 않음. 한 달 동안 실행하고 코드가 실제로 귀하의 인구에 대해 무엇을 말하는지 살펴보십시오. 모든 플랫폼의 기준선은 다르며, 가정된 기준선에 대해 강제 적용하는 것은 오탐을 생성합니다.
  3. 경고 경로 연결. 트래픽 계층 경고를 확인 트리거에 연결하십시오. 이것은 두 계층의 가치를 높이는 통합입니다.
  4. 상위 계층에 바인딩 추가. 높은 할당량 및 신용 에스컬레이션 시 전체 확인. 조직 및 연구 계층 시 비즈니스 확인.
  5. 강제 적용 런북 구축. 먼저 클러스터를 해결한 다음, 확인된 세션에서 모든 항목 유형에 걸쳐 차단 목록에 추가하고, 강제 적용이 성공했는지 확인하십시오. 해결하기 전에 강제 적용하면 하나의 계정이 차단되고 운영자에게 경고가 전송됩니다.
  6. 친구 허용 목록에 추가. 어떤 것을 강화하기 전에, 설계 파트너 및 기업 엔지니어링 팀을 명시적으로 제외하십시오.

이것이 작동을 멈추는 지점

정직한 전략집은 자체 한계를 명시합니다.

추출을 감지하지 못합니다. 신원 인프라는 귀하의 프롬프트를 보지 못합니다. 트래픽 계층이 약하면 액세스 계층은 보상하지 않습니다. 플래그 지정하지 않은 행위자를 충실히 해결할 것입니다.

결단력 있고 자금력이 풍부한 운영자는 여전히 침입할 수 있습니다. 실제 문서를 가진 실제 사람들에게 실제 장치에서 계정을 열도록 비용을 지불하는 것은 모든 신원 제어를 무력화합니다. 계정이 실제로 다르기 때문입니다. 이것이 변화시키는 것은 가격입니다. 거의 비용이 들지 않던 계정 농사는 이제 모집, 조정 및 인당 간접비가 들며, 결과 네트워크는 더 작고 재생성 속도가 느립니다.

모든 레이어는 오탐을 생성합니다. 공유 사무실은 DUPLICATED_IP_ADDRESS를 생성합니다. 가족은 장치를 공유합니다. 개발자는 합법적으로 두 개의 계정을 가집니다. 이것이 중복 신호가 기본적으로 정보 제공용이며 정책을 설정하는 것이 귀하의 책임인 이유입니다.

확인은 실제 마찰과 깔때기에 대한 실제 비용이 있습니다. 계층화는 이들을 결코 접해서는 안 되는 사람들에게서 멀리 떨어뜨리기 위해 존재하지만, 그 효과는 0이 아닙니다. 측정하십시오.

이것은 비용 함수이지 벽이 아닙니다. 성공은 "추출이 불가능해졌다"가 아닙니다. 성공은 2만 개의 계정이 필요한 캠페인이 이제 2만 개의 확인된 신원을 필요로 하며, 각 제거에 운영자가 이메일 주소보다 더 많은 비용을 지불해야 하고, 단일 확인된 사례가 관련 모든 것에 전파되는 것입니다.

자주 묻는 질문

가장 먼저 해야 할 가장 영향력 있는 일은 무엇입니까?

모든 유료 계정에서 $0.03로 장치 및 네트워크 신호를 수집하십시오. 첫날에는 아무것도 하지 않는 것처럼 보이지만, 모든 후속 조사가 가능하게 하는 이유입니다. 소급 적용할 수 없습니다.

네 가지 기본 요소가 모두 필요합니까?

아니요. 수집 및 연결은 대부분의 분석 가치를 제공합니다. 바인딩 및 강제 적용은 이를 기반으로 행동할 수 있도록 합니다. 수집부터 시작하십시오.

이것이 이미 실행 중인 감지 분류기와 어떻게 상호 작용합니까?

서로 보완합니다. 귀하의 분류기는 이 계정이 잘못된 행동을 하고 있다고 말합니다. 얼굴, 장치 및 네트워크 연결은 이것은 하나가 아니라 30개의 계정이다라고 말합니다. 차단 목록 전파는 응답이 모든 계정을 포함하도록 합니다. 어느 레이어도 다른 레이어의 작업을 수행하지 않습니다.

Didit은 선도적인 AI 회사에 배포되어 있습니까?

누가 Didit을 사용하는지에 대해서는 논의하지 않습니다. 여기에 설명된 모든 내용은 문서화되고 공개적으로 가격이 책정된 기본 요소로 구축되었으며, 어떤 팀이든 매월 500건의 무료 KYC 확인부터 시작하여 자체 아키텍처에 대해 평가할 수 있습니다.

인간이 아닌 AI 에이전트 확인은 어떻습니까?

에이전트 신원은 실제적이고 해결되지 않은 문제이며, Didit의 MCP 서버는 라이브 상태이며 무료입니다. 그러나 지금까지 측정된 추출 캠페인은 인간이 등록한 계정에서 대규모로 실행되며, 이것이 이 전략집이 다루는 문제입니다.

이것이 증류를 완전히 막을 수 있습니까?

아니요. 모델 수준 출력 제어 및 의미론적 트래픽 감지는 여전히 필요하며 모델 제공자가 소유합니다. 액세스 계층은 익명성을 줄이고, 계정 간에 행위자를 해결하며, 재생성 비용을 높이고, 기존 경고에 대해 조치를 취할 수 있도록 합니다. 이것이 주장이며, 전체 주장입니다.

시작할 준비가 되셨습니까?

어떤 기본 요소를 사용하기로 결정하기 전에 가격을 책정할 수 있는 기본 요소로 액세스 계층을 구축하십시오.

신원 및 사기 방지 인프라.

KYC, KYB, 거래 모니터링, 지갑 심사를 위한 단일 API. 5분 만에 통합하세요.

AI에게 이 페이지 요약 요청
모델 추출 방어를 위한 액세스 레이어 전략 | Didit.