본문으로 건너뛰기
Didit, 신원·사기 방지 인프라 구축 위해 750만 달러 투자 유치
Didit
블로그로 돌아가기
블로그 · 2026년 8월 4일

히드라 계정 문제: 증류 방어가 신원 확인에서 시작되는 이유 (KO)

Anthropic은 약 24,000개의 사기성 계정을 통해 1,600만 건의 교환이 발생했으며, 하나의 프록시 네트워크가 20,000개 이상의 계정을 동시에 운영했다고 보고했습니다. 증류는 프롬프트 문제가 아니라 접근 문제입니다.

작성자: Didit업데이트됨
llm-distillation-defense-identity.png

2026년 2월 23일, Anthropic은 AI 산업이 추상적으로만 논의했던 내용에 대한 측정된 수치를 발표했습니다. 확인된 증류 캠페인에서, 이 회사는 연구소들이 "약 24,000개의 사기성 계정을 통해 Claude와 1,600만 건 이상의 교환을 생성했다"고 보고했습니다. 이 보고서의 한 가지 세부 사항은 전체 문제를 재구성합니다: "단일 프록시 네트워크가 20,000개 이상의 사기성 계정을 동시에 관리했습니다."

2만 개의 계정. 한 명의 행위자.

이것이 위협의 형태입니다. 적대적 증류(프런티어 모델의 출력을 사용하여 더 저렴한 사본을 훈련하는 것)는 하나의 의심스러운 계정이 하나의 의심스러운 요청을 함으로써 실행되지 않습니다. 이는 단일 추출 캠페인을 수천 개의 계정, 결제 수단, 장치 및 네트워크 경로에 분산시켜 각 개별 계정이 눈에 띄지 않도록 하는 조직에 의해 실행됩니다. 하나씩 검토하면 아무것도 걸리지 않습니다. 그래프로 검토하면 하나의 기계입니다.

이것이 방어가 모델이나 트래픽에만 존재할 수 없는 이유입니다. 또한 이러한 계층이 답할 수 없는 질문에 답해야 합니다. 실제로 이 계정들 뒤에 누가 있습니까?

주요 내용

  • Anthropic은 확인된 증류 캠페인에서 약 24,000개의 사기성 계정을 통해 1,600만 건 이상의 교환이 생성되었으며, 단일 프록시 네트워크가 20,000개 이상의 계정을 동시에 운영했다고 보고했습니다.
  • 증류는 단일 요청 문제가 아니라 조정된 접근 문제입니다. 계정별 검토는 구조적으로 이를 파악할 수 없습니다.
  • 프런티어 모델 포럼의 2026년 2월 이슈 브리프는 적대적 증류 및 그 방법을 정의합니다. 의도적으로 통제보다는 위협에 초점을 맞추고 있으므로 계정 확인, 신원, 속도 제한 또는 접근 제어에 대한 권장 사항을 제시하지 않습니다.
  • Anthropic의 자체 완화 목록에는 탐지 분류기 및 행동 지문과 함께 "교육 및 스타트업 계정에 대한 강화된 확인"이 포함됩니다.
  • 확인된 접근 계층은 모델 제어가 할 수 없는 세 가지를 수행합니다: 익명성을 감소시키고, 사람, 장치 또는 네트워크를 공유하는 계정을 연결하며, 재생성된 계정이 도착 즉시 차단되도록 합니다.
  • 신원 확인만으로는 모델 추출을 방지할 수 없습니다. 이는 세 가지 계층 중 하나이며, 다른 두 가지를 대체하지 않습니다.

실제로 일어난 일

Anthropic의 보고서는 전체를 읽을 가치가 있지만, 접근 제어를 설계하는 사람에게는 세 가지 발견이 가장 중요합니다.

볼륨은 소수의 행위자에 집중되었습니다. Anthropic은 MiniMax에 "1,300만 건 이상"의 교환, Moonshot AI에 "340만 건 이상", DeepSeek에 "150,000건 이상"을 귀속시켰습니다. 이는 기회주의적인 스크랩이 아닙니다. 지속적인 산업 프로그램입니다.

계정은 조정되었고, 조정은 메타데이터에서 볼 수 있었습니다. Anthropic은 계정 전반에 걸쳐 "동일한 패턴, 공유된 결제 방법, 조정된 타이밍"이 "'로드 밸런싱'을 시사한다"고 설명했습니다. 귀속은 "요청 메타데이터 및 인프라 지표"에서 나왔습니다. 한 경우에는 "Moonshot 고위 직원의 공개 프로필과 일치하는" 요청 메타데이터였습니다.

프롬프트는 터무니없는 규모로 반복되었습니다. Anthropic은 "수백 개의 조정된 계정에 걸쳐 수만 번" 도착하는 프롬프트 변형을 언급했습니다.

이 세 가지를 함께 읽으면 패턴이 나타납니다. 이러한 캠페인을 노출시킨 거의 모든 신호는 관계형 신호였습니다. 즉, 계정 간에 공유되는 것이었습니다. 공유된 결제 방법. 공유된 타이밍. 공유된 인프라. 공유된 프롬프트 템플릿. 분석 단위가 단일 계정이라면 이 중 어느 것도 보이지 않습니다.

계정별 검토가 실패하는 이유

대부분의 남용 도구는 계정별 판결을 중심으로 구축됩니다. 계정이 등록되고, 점수가 매겨지고, 위험 등급이 부여되고, 결정이 내려집니다. 이 모델은 설계된 남용(도난당한 카드를 사용하는 사기꾼, 채널에 스팸을 보내는 스패머)에 잘 작동합니다.

이는 특정 구조적 이유로 인해 증류에 실패합니다: 공격자는 단일 계정이 수행하는 캠페인의 양을 제어합니다.

검토 임계값이 "50,000개의 비정상적인 요청을 하는 계정"이라면, 공격자는 각각 800개의 요청을 하는 20,000개의 계정을 사용합니다. 임계값이 떨어지면 계정을 추가합니다. 계정은 시스템에서 가장 저렴한 입력이기 때문에 경제학은 공격자에게 유리합니다. 프런티어 모델 API 호출에는 실제 한계 비용이 있지만, 이메일 주소는 그렇지 않습니다.

따라서 공격자의 최적화 문제는 간단합니다: 계정당 행동을 계정당 임계값 미만으로 유지하고 수평적으로 확장합니다. 그리고 이는 방어가 잘못된 대상을 측정하고 있기 때문에 작동합니다. 적이 행위자일 때 계정을 측정하고 있습니다.

이것이 히드라 속성입니다. 하나의 계정을 잘라내면 두 개가 더 나타납니다. 계정을 생성하는 것이 전혀 건드려지지 않았기 때문입니다. Anthropic이 보고한 것처럼 20,000개 이상의 계정을 동시에 운영하는 프록시 네트워크는 그것의 순수한 표현입니다. 그 규모에서 계정을 하나씩 제거하는 것은 방어가 아니라 유지 보수 작업입니다.

히드라를 물리치려면 머리를 자르는 것을 멈추고 몸통을 찾아야 합니다.

증류 방어의 세 가지 계층

심각한 방어는 세 가지 계층으로 구성되며, 각각 다른 주체가 소유합니다.

계층소유자역할
모델 제어모델 제공업체민감한 추론 추적 제한, 출력 형태 지정, 모델 행동 보호
트래픽 탐지모델 제공업체 또는 연구/벤더 스택반복적이고 의미론적으로 집중된 또는 조정된 추출 패턴 탐지
확인된 접근신원 인프라계정 뒤에 누가 있는지 확인, 공유된 식별자 연결, 확인된 남용자와 관련된 모든 것에 정책 적용

처음 두 계층은 잘 이해되고 활발하게 연구되고 있습니다. 트래픽 측면에서 최근 학술 연구는 진정으로 고무적입니다: Liu, Guo 및 Dong(arXiv 2606.05725, 2026년 6월)은 추출 모니터링을 양성-보정된 트래픽-윈도우 분포 테스트로 구성하며, 양성 트래픽에만 보정된 의미 공간에서 최대 평균 불일치를 사용합니다. 네 가지 추출 시나리오에서 14개의 공격자-정상 쿼리 쌍에 걸쳐, 양성 쿼리에서 0.3%의 오탐율로 순수 공격자 사례에 대해 100% 탐지율을 보고합니다.

이는 강력한 결과이며, 그 의미를 명확히 할 가치가 있습니다: 트래픽 탐지는 작동하며, Didit이 이야기하는 계층이 아닙니다. 프롬프트 분포의 의미론적 분석은 모델 제공업체의 역할이며, 그곳에 머물러야 합니다.

세 번째 계층은 산업 자체의 위협에 대한 표준 브리프를 포함하여 가장 적게 게시된 설계 지침을 가진 계층입니다.

표준 브리프가 다루는 내용

프런티어 모델 포럼은 Anthropic의 보고서와 같은 날 적대적 증류 이슈 브리프를 발표했습니다. 좋은 문서입니다. 이는 적대적 증류를 모델의 출력을 은밀하게 접근하여(일반적으로 서비스 약관 위반) 교사의 기능을 복제하는 보조 모델을 훈련하는 것으로 정의합니다. 안전 훈련을 우회하면서 말이죠. 방법론을 분류합니다: 사고 과정 유출, 사고 과정 비판, 사고 과정 자동 채점, 강화 학습을 위한 프롬프트 생성, 합성 데이터 생성. 대상 기능을 명시합니다: 수학적 및 과학적 추론, 에이전트 코딩, 다중 모드 처리, 일반 추론.

또한 이 분야의 실제 긴장을 인정합니다. "합법적인 연구를 방해하지 않으면서 이러한 보안 우려를 해결하는 것"입니다.

여기에는 계정 확인, 신원 확인, 속도 제한 또는 접근 제어에 대한 권장 사항이 포함되어 있지 않습니다.

이는 범위 선택이며, 합리적인 선택입니다. 브리프는 위협과 그 방법을 정의하는 것을 목표로 하며, 제어를 규정하는 것이 아닙니다. 접근 계층 설계는 단순히 다른 문서입니다.

그러나 산업은 아직 이 문서를 작성하지 않았습니다. 위협을 측정한 연구소는 탐지 분류기 및 행동 지문과 함께 "교육 및 스타트업 계정에 대한 강화된 확인"을 투자하는 완화 조치 중 하나로 나열했습니다. 접근 계층은 실제로 작동하고 있지만, 게시된 설계 지침은 거의 없습니다. 이것이 이 게시물의 나머지 부분에서 다룰 내용입니다.

확인된 접근 계층이 실제로 하는 일

여기서 주장에 대해 정확하게 설명해야 합니다. 과장된 주장은 이 전체 범주의 신뢰성을 떨어뜨리기 때문입니다.

신원 확인은 증류를 탐지하지 못합니다. 프롬프트 의미를 볼 수 없고, 어떤 기능이 대상인지 알 수 없으며, 요청 스트림이 사고 과정 유출처럼 보인다고 알려주지 않습니다. 그것은 트래픽 계층의 역할입니다.

신원이 하는 일은 네 가지 특정 방식으로 공격자의 비용 구조를 변경하는 것입니다.

익명성을 감소시킵니다. 확인된 개인 또는 등록된 회사에 연결된 계정은 귀속 가능한 소유자가 있는 계정입니다. 이것이 남용을 막지는 못하지만, 남용의 비용과 위험을 변화시킵니다.

물리적인 것을 공유하는 계정을 연결합니다. 동일한 얼굴, 동일한 장치 또는 동일한 네트워크로 등록된 두 계정은 행동이 관련되어 보이지 않더라도 관련되어 있습니다. 이것은 계정별 검토가 생성할 수 없는 신호이며, Anthropic이 설명한 캠페인을 드러낸 신호의 정확한 종류입니다. 즉, 공유된 결제 방법, 공유된 타이밍, 공유된 인프라입니다.

재생성을 비싸게 만듭니다. 히드라 속성은 새 계정이 저렴하고 이전 계정과 연결되지 않는다는 점에 달려 있습니다. 확인된 남용 사례가 접촉한 모든 식별자(얼굴, 문서, 전화, 이메일, IP 및 장치)로 전파될 때, 동일한 인프라에서 생성된 다음 계정은 800개의 요청 후에 잡히는 대신 문턱에서 실패합니다.

합법적인 개발자에게 마찰을 주지 않습니다. 이것이 전체를 실행 가능하게 만드는 제약입니다. 모든 사람에게 적용되는 확인은 성장세입니다. 접근 계층, 할당량, 신용량, 지리 또는 트래픽 계층의 행동 경고에 따라 적응적으로 적용되는 확인은 위험에 마찰을 가하고 신뢰할 수 있는 개발자 경로를 빠르게 유지합니다.

네 가지. 그 중 어느 것도 "추출 방지"가 아닙니다. 네 가지 모두 현실입니다.

Didit의 역할

Didit은 신원 및 사기 방지 인프라이며, 확인된 접근 계층을 구성하는 기본 요소는 이미 우리가 제공하고 가격을 공개하고 있는 것들입니다:

  • 신원 확인 — 신분증 문서, 수동적 생체 인식, 얼굴 일치 및 IP 분석, 검증당 $0.33로 묶여 있으며, 월 500건의 무료 KYC 확인이 제공됩니다.
  • 얼굴 검색 1:N — 귀하의 애플리케이션에 등록된 확인된 사용자들을 대상으로 하는 생체 인식 검색, 확인 시 무료입니다. 이것은 두 계정을 한 사람에게 연결하는 기본 요소입니다.
  • IP 및 장치 분석 — $0.03이며, $0.33 번들에 포함됩니다. DUPLICATED_IP_ADDRESS, DUPLICATED_DEVICE_FINGERPRINT, DEVICE_RECOVERED_HIGH_CONFIDENCE, AUTOMATION_FRAMEWORK_DETECTED 및 관련 코드를 발행합니다.
  • 목록 API — 12가지 항목 유형에 걸친 차단 목록으로, 확인된 세션에서 차단 목록에 추가하면 해당 세션이 캡처한 식별자(얼굴, 문서, 전화, 이메일, IP 및 장치)가 자동으로 추출됩니다.
  • 생체 인식 인증 — $0.10의 비밀번호 없는 재확인으로, 권한 있는 작업을 베어러 토큰이 아닌 온보딩된 사람에게 연결합니다.
  • 사업체 확인 — 회사당 $2.00부터: 등록 조회, 최종 소유자 및 임원, 사업체 심사는 $0.20이며, 최종 소유자에 대한 연결된 신원 확인은 표준 사용자 확인 요금으로 청구됩니다. 조직 및 연구 계층 접근용입니다.

이러한 요소들을 플랫폼에 필요한 정책으로 구성할 수 있습니다. 구성은 귀하의 아키텍처이며, 기본 요소는 부품입니다. 모든 요소는 공개된 가격과 최소 요건 없이 통합 /v3/ API를 통해 제공됩니다. 일부는 POST /v3/face-search/와 같은 자체 엔드포인트로 제공되고, 일부는 자체 독립형 엔드포인트가 없는 생체 인식 인증과 같은 세션 워크플로를 통해 제공됩니다.

사용 사례

프런티어 모델 제공업체. 높은 할당량, 높은 신용 및 연구 계층 접근을 확인된 개인 또는 회사에 연결하고, 무료 및 낮은 볼륨 계층은 마찰 없이 유지합니다.

AI API 플랫폼 및 추론 제공업체. 리셀러 및 애그리게이터는 탐지 스택을 상속하지 않고 남용을 상속합니다. 접근 계층은 종종 그들이 현실적으로 소유하는 유일한 제어 수단입니다.

AI 코딩 및 에이전트 제품. 시험 남용 및 크레딧 파밍은 증류와 동일한 계정 증식 메커니즘을 사용합니다. 동일한 연결 기본 요소가 둘 다 해결합니다.

클라우드 AI 플랫폼 및 마켓플레이스. 조직 수준 확인은 기업 할당량이 부여되기 전에 "이것이 실제 최종 소유자가 있는 실제 회사인가"에 답합니다.

자주 묻는 질문

신원 확인이 모델 증류를 방지합니까?

아니요. 추출은 모델 수준 출력 제어 및 의미론적 트래픽 탐지에 의해 (가능한 한) 방지됩니다. 신원은 익명성을 감소시키고, 캠페인 전반에 걸쳐 계정을 연결하며, 재생성된 계정이 일찍 실패하도록 만듭니다. 세 가지 계층 중 하나입니다.

확인이 합법적인 개발자들을 떠나게 하지 않을까요?

모든 사람에게 적용하는 경우에만 그렇습니다. 효과적인 설계는 적응적입니다. 위험, 계층, 할당량, 신용량, 지리 또는 행동 경고에 따라 확인합니다. 대부분의 개발자는 확인 단계를 볼 필요가 없습니다. Didit의 재사용 가능한 KYC는 무료이므로, 네트워크의 다른 곳에서 이미 확인된 개발자는 다시 할 필요 없이 확인을 통과할 수 있습니다.

Didit이 요청 스트림이 증류처럼 보인다고 알려줄 수 있습니까?

아니요. Didit은 귀하의 프롬프트를 보지 않으며 요청 의미를 분석하지 않습니다. 해당 신호는 귀하의 트래픽 계층에서 나옵니다. Didit이 제공하는 것은 해당 경고를 행위자에게 연결하기 위한 신원 확인과, 해당 행위자와 연결된 모든 계정에 걸쳐 조치를 취하기 위한 시행 기본 요소입니다.

AI 플랫폼 규모에서 비용은 얼마입니까?

확인은 성공적인 확인당 가격이 책정되며 최소 요건은 없습니다. 전체 신원 번들은 $0.33, IP 및 장치 분석 단독은 $0.03, 얼굴 검색 1:N은 무료, 생체 인식 재인증은 $0.10, 사업체 확인은 $2.00부터입니다. 정책이 적응적이므로, 실제로 확인이 필요한 접근의 일부에 대해서만 비용을 지불합니다. 매월 첫 500건의 KYC 확인은 무료입니다.

이미 사기 방지 벤더가 있습니다. 이것은 왜 다릅니까?

대부분의 사기 방지 도구는 계정별 판결을 반환합니다. 증류 문제는 행위자별 문제이며, 계정을 한 행위자에게 연결하는 기본 요소(사용자 전체에 걸친 1:N 생체 인식 검색, 장치 및 IP 상관 관계, 단일 확인된 사례에서 모든 식별자로 차단 목록 전파)는 계정별 채점이 수행하지 않는 특정 사항입니다.

시작할 준비가 되셨습니까?

오늘 놓치고 있는 연결 신호를 생성하는 기본 요소부터 시작하십시오.

신원 및 사기 방지 인프라.

KYC, KYB, 거래 모니터링, 지갑 심사를 위한 단일 API. 5분 만에 통합하세요.

AI에게 이 페이지 요약 요청