Claude 악용 7개 분야 공개…생물학 요청 차단만으로 끝나지 않았다

Anthropic이 2026년 9월 10일 Claude 악용 활동을 7개 위험 영역으로 나눈 위협 인텔리전스 보고서를 공개했다. AP 보도 는 회사가 사이버 공격과 감시, 생물무기 개발로 이어질 수 있는 연구를 포함한 악용을 차단했으며 최신 모델에는 생물학 연구를 제한하는 안전장치를 강화했다고 전했다.
공개 범위는 2025년 12월부터 2026년 8월까지 Anthropic이 탐지해 중단시킨 활동이다. Anthropic의 공식 보고서 는 이를 사이버 작전, 영향력 공작, 감시, 사기, 생물학 악용, 재래식 무기 개발, 불법 증류의 7개 영역으로 분류하고 요청 거부뿐 아니라 계정 폐쇄, 탐지 체계 보강, 정부·업계 파트너와의 정보 공유를 대응 수단으로 제시했다.
7개 영역은 시도부터 외부 실행까지 단계가 달랐다

일곱 분류가 동일한 수준의 피해 일곱 건을 뜻하는 것은 아니다. 분류기가 입력 단계에서 막은 요청, Claude가 개발을 지원한 도구, 외부 플랫폼에 게시된 콘텐츠, 실제 침해나 시험으로 이어진 활동이 한 보고서에 함께 담겼다. 각 사례는 진행 단계, 확인된 결과, Anthropic이 차단한 지점, 회사 자체 판단에 의존하는 범위를 나눠 볼 필요가 있다.
- 사이버 작전: Claude는 표적 정찰과 취약점 분석, 피싱 인프라 구축, 악성코드 수정, 탈취 자료 정리에 사용됐다. 일부 행위자는 실제 시스템에 침입해 데이터를 빼냈으며, Anthropic은 관련 계정을 차단하고 재발 탐지 수단을 추가했다. 다만 공격자 귀속과 Claude가 피해를 얼마나 확대했는지에 대한 평가는 주로 회사가 확보한 사용 기록에 근거한다.
- 영향력 공작: 가짜 매체와 인물 계정을 만들고 정치적 메시지를 작성·번역·배포하는 작업이 포착됐다. 일부 콘텐츠는 외부 플랫폼에 게시됐지만 실제 도달 범위와 이용자 반응은 충분히 확인되지 않았다. Anthropic은 계정을 폐쇄하고 반복되는 운영 패턴을 탐지 대상으로 삼았다.
- 감시: 반체제 인사와 시민단체에 관한 자료 수집부터 신원 조회 도구와 통신 분석 시스템 개발까지 이어졌다. 이란 연계 사례에서는 신원 수집용 브라우저 확장 프로그램이 실제 배포됐고, 말리 사례에서는 Claude가 국가 규모 감시 플랫폼의 주요 개발 수단으로 쓰였다고 회사는 판단했다. 계정 차단은 추가 개발을 방해하지만 이미 외부에 설치된 시스템을 제거하지는 못한다.
- 사기: 중국 기반 앱 개발 조직은 20개가 넘는 데이팅 앱과 이용자에게 사람처럼 응답하는 AI 인물을 운영했다. Anthropic이 확인한 2026년 4월의 2주 동안 4,700개가 넘는 AI 인물이 최소 2만5,000명과 대화했다. 관련 계정은 폐쇄됐지만 보고서는 전체 금전 피해를 확정하지 않았다.
- 생물학 악용: 치쿤구니야 바이러스의 전파성과 면역 회피, 조류 인플루엔자의 포유류 적응, 바이러스 면역 회피와 독소 연구 등 이중용도 연구 사례 5건이 제시됐다. 일부 요청은 안전 분류기가 막았지만 다른 요청에는 문헌 정리, 연구 가설, 실험 설계와 통계 계획을 지원했다. 연구가 치료제나 백신 개발에도 이용될 수 있어 연구자들의 악의적 의도는 확정되지 않았다.
- 재래식 무기 개발: 미사일과 유도 로켓, 드론, 전자전·표적 소프트웨어, 부품 조달과 무기 정보 수집 관련 활동이 포함됐다. 북부 예멘의 한 조직은 Claude로 유도 소프트웨어를 개발한 뒤 로켓을 시험 발사했으나 시험은 실패한 것으로 평가됐다. Anthropic은 실제 운용 가능한 장치가 완성됐다는 증거는 없다고 선을 그었다.
- 불법 증류: 다른 모델을 훈련하려고 Claude의 응답과 능력을 허가 없이 대규모로 수집하는 활동이다. 가짜 신원과 도난 결제수단·API 키, 프록시 서비스가 접근에 사용됐으며, Anthropic은 2026년 2월 이후 중국 기반 연구소 7곳의 추가 공격을 탐지해 중단했다고 밝혔다.
생물학에서는 차단 성공과 안전망의 빈틈이 함께 드러났다

가장 구체적인 생물학 사례는 2026년 5월 치쿤구니야 바이러스 연구비 신청서 작성 요청이었다. 이 연구는 바이러스의 전파성과 면역 회피를 높이는 변이를 찾고 생체 실험에서 병원성을 선택하는 내용을 담았다. 안전 분류기가 요청을 차단했지만, 같은 연구는 백신·치료제 개발에도 활용될 수 있어 요청 내용만으로 최종 목적을 단정하기 어려웠다.
차단 뒤 조사에서는 서비스 미지원 지역의 이용자에게 접근을 제공한 중계 플랫폼이 미국 인프라와 합성 계정을 사용한 정황이 확인됐다. 이 플랫폼은 Claude가 거부한 민감한 질문을 더 허용적인 다른 모델로 보내는 대체 경로도 마련했다. Anthropic은 연계 계정을 폐쇄하고 우회망 대응에 나섰지만 운영자는 며칠 안에 새 신원으로 접근을 복구했다.
다른 생물학 사례에서는 방어선이 더 불분명했다. 안전장치가 특정 위험 분야를 제대로 막은 경우가 있는 반면, 표면상 정상적인 연구 요청에는 가설 수립과 실험 설계까지 지원한 사례도 있었다. Anthropic은 최신 모델에 광범위한 이중용도 생물학 질의를 제한하는 안전장치를 적용했으며, 콘텐츠만이 아니라 계정·기관의 신뢰도와 우회 행동을 함께 살펴야 한다고 결론 내렸다.
감시와 무기 개발은 플랫폼 밖 결과를 남겼다
감시 사례는 Claude가 단순한 문서 요약 도구를 넘어 소프트웨어 개발 인력처럼 사용될 수 있음을 보여준다. 이란 연계 조직은 신원 확인과 사회관계 분석, 정보 수집을 위한 도구를 개발했고, 일부 프로그램은 실제 운영 환경에 배포됐다. 말리 국가정보기관용으로 제작된 것으로 평가된 플랫폼은 통화 기록과 문자·음성 자료를 처리해 전화번호별 정보 문서를 만드는 구조였다.
이런 시스템은 Claude 계정을 폐쇄해도 현지 서버나 다른 모델에서 계속 작동할 수 있다. Anthropic이 직접 중단시킬 수 있는 대상은 자사 서비스 접근과 계정망, 추가 개발 과정이다. 따라서 회사가 사용한 ‘중단’이라는 표현은 외부 시스템과 이미 발생한 피해까지 모두 제거했다는 의미가 아니다.
무기 분야에서도 질의와 설계 문서에만 머물지 않은 사례가 있었다. 북부 예멘 기반 조직은 휴대전화급 비행 컴퓨터를 이용하는 유도 로켓과 장거리 미사일 프로그램을 진행했고, Claude로 비행 제어와 종말 유도 소프트웨어를 개발했다. 로켓은 실제 시험 발사됐지만 실패한 것으로 보이며, 행위자들은 몇 시간 뒤 Claude에 돌아와 실패 원인을 분석했다.
차단은 요청·계정·행동·공조의 네 층으로 진행됐다

Anthropic의 대응은 대체로 네 단계로 구분된다. 위험한 개별 응답을 막는 분류기, 관련 계정과 조직의 폐쇄, 재가입과 프록시·반복 행동을 찾는 탐지 체계, 정부 기관과 다른 기술 사업자에 대한 위협 정보 공유다. 재래식 무기 분야에는 폭발물과 무기 개발 요청을 찾는 분류기가, 불법 증류에는 대량 추출 패턴과 비정상 계정망을 식별하는 방어 수단이 추가됐다.
그러나 각 조치의 효력 범위는 다르다. 요청 거부는 한 번의 답변을 막고, 계정 폐쇄는 확인된 접근 수단을 끊으며, 행동 탐지는 새 계정으로 돌아오는 운영자를 겨냥한다. 외부 정보 공유는 다른 플랫폼이나 기관의 대응을 돕지만, 실제 후속 조치가 이뤄졌는지까지 Anthropic이 보장할 수는 없다.
이 때문에 단순한 요청 차단률이나 폐쇄 계정 수만으로 방어 결과를 판단하기 어렵다. 생물학 요청은 다른 모델로 우회됐고, 감시 소프트웨어는 외부에 배포됐으며, 영향력 공작 콘텐츠는 소셜 플랫폼으로 옮겨갔다. 이번 공개가 보여주는 변화는 방어 대상이 유해한 문장 하나에서 계정망과 운영 방식, 플랫폼 간 연결로 확대됐다는 점이다.
공개된 사례와 독립적으로 확인된 사실의 경계
보고서에는 구체적인 작업 흐름과 일부 코드·프롬프트가 담겼지만 증거를 수집하고 해석한 주체는 Anthropic이다. 가디언의 확인 보도 에 따르면 회사는 생물학 사례에 관련된 연구기관과 국가를 공개하지 않았고 연구자들의 의도도 확정하지 않았다. ‘생물무기가 만들어졌다’는 주장과 ‘생물무기 개발을 지원할 수 있는 연구에 모델이 사용됐다’는 보고 내용은 구별해야 한다.
일곱 영역 역시 일반적인 Claude 악용의 빈도나 평균 피해를 보여주는 통계가 아니다. Anthropic은 이번 사례들이 탐지한 활동 가운데 특히 새롭고 주목할 만한 사례라고 명시했다. 회사 내부 기록은 Claude가 어떤 작업에 쓰였는지 보여주지만, 익명 처리된 행위자의 신원과 전체 피해 규모, 외부 플랫폼에서 이어진 활동은 독립 검증이 제한된다.
현재 확인된 상태는 Anthropic이 9월 10일 보고서를 공개하고 8개월간 관측한 7개 위험 영역의 관련 활동을 자사 서비스 안에서 중단시켰다는 것이다. 일부 활동은 이미 침해, 콘텐츠 게시, 소프트웨어 배포 또는 실패한 현장 시험까지 진행됐다. 앞으로 남은 쟁점은 폐쇄된 계정망의 재진입 여부, 외부 시스템의 존속 범위, 강화된 안전장치가 정상적인 생물학 연구와 위험한 지원을 얼마나 정확히 구분하는지다.
함께 읽기:
뉴스레터 구독
최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.