기술 및 혁신

Anthropic 안에 외부 평가팀이 들어간다…독립성은 아직 설계 중

|작성자: QUASA 편집팀|4 분 소요| 1
Anthropic 안에 외부 평가팀이 들어간다…독립성은 아직 설계 중

Anthropic과 Accenture가 2026년 9월 18일 외부 평가팀을 Anthropic의 모델 개발 과정에 배치할 계획을 발표했다. TechCrunch의 당일 보도 도 Accenture 인력이 회사 내부에서 모델과 개발 절차를 살피게 된다는 내용을 확인했다. 다만 이는 평가 결과나 완성된 운영체계의 공개가 아니라 앞으로 팀을 구축하겠다는 발표다.

Accenture의 9월 18일 발표 에 따르면 전담팀은 Anthropic 내부 조직 및 안전 파트너와 함께 모델 평가와 레드팀, 정렬 평가, 안전장치 시험을 수행한다. 두 회사는 AI 안전 역량을 구축하기 위해 향후 5년간 각각 최소 10억 달러를 투자할 것으로 예상한다고 밝혔다.

평가 작업은 Accenture의 전문 AI 사업부 Faculty가 이끈다. Anthropic의 제휴 설명 은 평가자에게 직원에 준하는 접근 권한을 제공하되, 접근 정보와 결과 보고에 관한 표준 및 독립 평가의 안정적인 재원 체계는 아직 없으며 초기 Accenture 작업의 비용은 Anthropic이 직접 부담한다고 명시한다. 제목의 ‘독립성은 아직 설계 중’이라는 판단은 바로 이 미정 상태를 가리킨다.

평가자는 완성된 모델 밖이 아니라 개발 과정 안을 본다

이번 방식의 핵심은 외부 조직이라는 소속보다 관찰 시점과 정보 접근 범위에 있다. 평가자는 출시를 앞둔 모델만 전달받는 데 그치지 않고, 모델이 훈련되는 과정과 구축·배포 결정이 형성되는 과정을 따라가며 직원에게 직접 질문할 수 있게 된다. 완성품의 결과만 검사하는 방식보다 위험이 만들어지는 맥락을 일찍 파악할 여지가 커지는 구조다.

확정된 업무 범위에는 모델의 성능·위험 평가, 적대적 조건을 조성하는 레드팀, 의도한 목표와 실제 행동의 일치 여부를 살피는 정렬 평가, 안전장치 시험이 포함된다. 사고를 보고하고 위험과 편익에 관한 정보를 대중에게 제공하는 역할도 제시됐다. 그러나 평가팀이 출시를 승인하거나 중단시킬 권한, 회사의 판단을 뒤집을 권한까지 갖는다는 내용은 공개되지 않았다.

최종 책임도 외부 팀으로 이전되지 않는다. Anthropic은 내장형 평가가 회사의 책임을 줄이는 장치가 아니라 그 책임의 이행 여부를 검증하기 위한 장치라고 설명한다. 따라서 ‘내부에 들어온다’는 사실은 더 많은 정보를 볼 가능성을 뜻하지만, 평가 결과가 실제 결정에 얼마나 영향을 미칠지는 별개의 문제다.

일반 외부 평가와 내장형 평가를 가르는 네 기준

두 방식을 비교할 때는 ‘외부’와 ‘내부’라는 위치만으로 독립성을 판단하기 어렵다. 이번 발표로 확인된 내용과 공개되지 않은 조건을 네 축으로 나누면 차이가 선명해진다.

  • 접근 권한: 일반 외부 평가는 개발사가 제공한 모델과 자료를 중심으로 진행되는 경우가 많다. 내장형 평가자는 직원에 준하는 접근을 통해 훈련 과정과 구축·배포 판단을 관찰할 예정이다. 다만 소스 코드, 훈련 자료의 특성, 내부 위험평가와 사고 기록 가운데 어디까지 열리는지는 공개되지 않았다.
  • 보고 경로: 평가자는 사고를 보고하고 대중에게 위험과 편익을 설명할 수 있다는 역할을 부여받는다. 그러나 중대한 문제를 누구에게 먼저 알리는지, Anthropic 경영진과 별도로 보고할 통로가 있는지, 회사가 공개 시점이나 범위를 제한할 수 있는지는 정해지지 않았다.
  • 이해상충: 평가자는 Accenture 소속이지만 초기 업무 비용은 평가 대상인 Anthropic이 낸다. 직접 지급 자체가 평가 결과의 종속을 증명하지는 않지만, 계약 갱신·보수와 평가 판단을 어떻게 분리하는지가 독립성의 핵심 조건이 된다.
  • 검증 가능한 산출물: 모델 평가와 레드팀, 정렬 평가, 안전장치 시험이라는 업무 범주는 확인됐다. 반면 시험 방법과 통과 기준, 발견 사항의 처리 과정, 외부에 공개할 보고서의 형식은 발표에 포함되지 않았다.

직원급 접근은 정보 부족을 줄이는 수단이지 독립성의 완성된 증거가 아니다. 불리한 발견도 수정 없이 보고할 수 있는 권한, 개발사가 이의를 제기하거나 공개를 제한했을 때 그 과정을 남기는 절차, 외부에서 확인할 수 있는 산출물이 함께 마련돼야 두 개념이 연결된다.

투자 전망과 평가 계약대금은 같은 숫자가 아니다

두 회사가 제시한 투자 전망을 단순 합산하면 5년간 최소 20억 달러다. 그러나 발표의 표현은 각 회사가 이 분야의 역량 또는 AI 안전에 투자할 것으로 ‘예상한다’는 것이다. 공동기금에 확정 금액을 납입했다거나, 전액을 Anthropic에 상주하는 한 팀에 배정했다는 뜻은 아니다.

세부 배분도 공개되지 않았다. 평가 인력과 시험 도구, 연구, 다른 AI 개발사를 위한 역량 구축에 얼마씩 쓰일지 알 수 없고, Anthropic이 Accenture에 지급할 계약대금도 제시되지 않았다. 따라서 20억 달러를 이번 제휴의 수주액이나 독립 평가팀의 예산으로 표현하면 발표보다 의미를 확대하게 된다.

현재 확인된 재원 관계는 Anthropic이 Accenture의 초기 평가 작업을 직접 부담한다는 점이다. 비용을 평가 대상이 내는 구조는 업무를 신속하게 시작할 수 있지만, 평가자가 계약 관계에 불리한 결론도 같은 조건으로 보고할 수 있는지를 묻게 한다. 반대로 비용 지급 사실만으로 평가가 무효라고 단정할 수도 없으므로, 결과 수정권과 공개 결정권, 계약 종료 시 처리 절차가 판단 근거가 된다.

독립성을 입증할 운영 규칙은 아직 공개되지 않았다

가장 먼저 필요한 정보는 접근 권한의 경계다. ‘직원에 준한다’는 표현만으로는 평가자가 어떤 모델 버전과 훈련 기록, 위험평가, 배포 판단에 접근할 수 있는지 알 수 없다. 자료 제공이 거부되거나 지연됐을 때 그 사실을 기록하고 외부에 알릴 수 있는지도 미정이다.

보고 체계 역시 독립성의 실질을 좌우한다. 평가팀이 Anthropic의 제품 조직이나 경영진에게만 결과를 전달하는지, Accenture 내부의 별도 책임자에게도 직접 보고하는지 공개되지 않았다. 출시 보류 같은 권고를 할 수 있는지, 권고가 받아들여지지 않을 경우 반대 의견이 남는지도 확인되지 않았다.

공개 규칙은 보안과 검증 가능성을 함께 다뤄야 한다. 모델의 취약점을 전부 공개하기 어려울 수 있지만, 시험 범위와 방법, 핵심 발견, 개발사의 대응을 요약한 자료조차 없다면 외부에서는 평가의 수준을 판단하기 어렵다. 영업비밀이나 보안을 이유로 비공개할 범위와 결정 주체도 운영 규칙에 포함될 사안이다.

현재까지 확정된 것은 Faculty가 이끄는 팀의 업무 범주, 직원에 준하는 접근 구상, 두 회사의 투자 전망과 Anthropic의 초기 비용 부담이다. 실제 업무 개시일과 팀 규모, 세부 접근 권한, 독립된 보고선, 결과 공개 형식은 알려지지 않았다. 앞으로 공개될 운영 기준이 접근 확대를 독립 검증으로 바꿀 수 있는지가 이번 제휴의 성격을 가르게 된다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0