
Anthropic 안전 평가에 20억 달러…독립성의 비용은 회사가 낸다

Anthropic과 Accenture는 2026년 9월 18일, Anthropic의 프런티어 AI 모델과 개발 과정을 내부에서 점검하는 내장형 평가팀을 구축하겠다고 발표했다. 두 회사는 향후 5년간 관련 평가 역량에 각각 최소 10억 달러를 투입할 계획이며, Reuters 보도 도 합계 최소 20억 달러의 계획과 Faculty의 평가 역할을 확인했다.
Accenture의 AI 전문 조직 Faculty는 모델 평가와 레드팀, 정렬 평가, 안전장치 시험을 맡을 예정이다. 2026년 9월 18일자 Accenture 발표 에 따르면 전담팀은 Anthropic의 내부 조직 및 안전 파트너와 함께 일하게 된다. 다만 이는 구축 계획의 발표이지, 평가팀의 가동이나 첫 보고서 발간이 완료됐다는 뜻은 아니다.
20억 달러는 평가 계약금이 아니다
제목의 20억 달러는 양사가 밝힌 최소 투자 예상액을 더한 수치다. Anthropic과 Accenture가 각각 5년간 최소 10억 달러를 관련 역량 구축에 투입할 것으로 예상하므로 합계는 최소 20억 달러다. 확정된 단일 계약 가격이나 특정 모델 한 종의 검사비로 해석해서는 안 된다.
공개된 발표에는 이 돈이 인력, 연구, 평가 도구와 운영비에 각각 얼마나 배분되는지 나와 있지 않다. 연도별 집행 일정, 회계상 투자 범위, Anthropic이 Accenture에 지급할 계약 금액도 공개되지 않았다. 따라서 현재 확인할 수 있는 것은 두 회사의 5년 투자 계획과 Anthropic이 Accenture의 평가 업무를 직접 지원한다는 자금 구조다.
두 사실은 독립성 논의에서 서로 다른 의미를 갖는다. 20억 달러는 평가 역량을 키우려는 전체 사업 규모를 보여주지만, 누가 개별 평가의 비용을 내는지는 평가자의 이해관계와 연결된다. 큰 투자액이 독립성을 보장하지는 않으며, 피평가 기업의 비용 부담만으로 평가 결과가 통제된다고 단정할 수도 없다.
직원급 접근이 바꾸는 평가 범위
내장형 평가의 차이는 완성된 모델만 외부로 넘겨 시험하는 방식보다 개발 과정에 더 일찍 들어간다는 데 있다. Anthropic의 공식 설명 은 평가자가 직원에 준하는 접근 권한으로 훈련 중인 모델의 변화를 보고, 구축·배포를 좌우하는 결정을 추적하며, 직원과 직접 대화할 수 있다고 밝힌다. 같은 발표는 Anthropic이 Accenture의 업무를 직접 지원하고, 접근 정보와 결과 보고에 관한 공통 기준 및 정착된 자금 체계는 아직 없다고 명시했다.
Faculty의 업무 범위는 모델의 행동과 성능을 살피는 평가, 취약한 반응을 찾는 레드팀, 개발 목적과 모델 행동의 일치 여부를 점검하는 정렬 평가, 적용된 안전장치의 작동 시험으로 제시됐다. 단순히 최종 출력의 유해성만 검사하는 것이 아니라 안전 약속이 실제 개발과 배포 결정에 반영되는지도 살펴볼 수 있다는 구상이다.
이 접근은 외부 평가자가 제한된 표본과 공개 자료만 보는 경우보다 더 많은 맥락을 제공할 수 있다. 훈련 과정에서 행동이 어떻게 변했는지, 위험이 발견됐을 때 어떤 판단이 내려졌는지, 회사의 공개 약속과 내부 운영 사이에 간극이 있는지를 확인할 여지가 생긴다. 사고를 보고하고 위험과 편익에 관한 정보를 대중에게 제공하는 역할도 구상에 포함돼 있다.
그러나 ‘직원급’은 무제한 접근을 뜻하지 않는다. 발표문에는 평가자가 볼 수 있는 훈련 자료, 내부 기록, 사고 보고서와 경영진 결정의 구체적인 범위가 없다. 회사가 자료 제공을 거부할 때 이의를 제기할 절차나, 제공된 정보가 완전한지 독자적으로 확인할 권한도 공개되지 않았다.
외부 소속과 독립성은 같은 말이 아니다
Faculty는 Anthropic 조직 밖에 있지만 Anthropic의 내부팀과 나란히 일하고 비용도 Anthropic에서 받는다. 외부 소속, 내부 접근, 피평가자의 직접 자금 지원이 동시에 존재하는 구조다. 외부 소속은 내부 안전팀과 다른 판단을 내릴 거리를 줄 수 있지만, 계약 범위와 보수, 갱신 여부를 피평가 기업에 의존한다면 불리한 결론을 끝까지 조사하고 공개할 수 있는지는 별도의 문제다.
Anthropic은 장기적으로 여러 기업이 함께 조성하는 공동 기금이나 정부 재원을 선호한다는 입장을 냈다. 아직 그런 체계가 없기 때문에 당장은 Accenture의 업무를 직접 지원한다는 설명이다. 자금 관계를 공개했다는 점은 구조를 판단할 정보를 제공하지만, 공개 자체가 이해상충을 통제하는 장치는 아니다.
독립성을 실제로 가르는 것은 평가자라는 명칭보다 권한과 계약 조건이다. 부정적인 결과를 원문 그대로 공개할 수 있는지, 중대한 사고를 외부 기관에 알릴 수 있는지, 피평가 기업이 평가 범위를 일방적으로 줄이거나 보고서 공개를 막을 수 없는지가 핵심이다. 양사의 발표에는 이러한 보호조항이나 분쟁 해결 절차가 제시되지 않았다.
발표로 확인된 것과 남은 공백
- 투자: 두 회사는 각각 5년간 최소 10억 달러를 관련 역량에 투입할 것으로 예상한다. 합계 최소 20억 달러는 계획된 전체 투자액이지 공개된 평가 용역비가 아니다.
- 평가 조직: Faculty가 모델 평가, 레드팀, 정렬 평가와 안전장치 시험을 맡고 Anthropic의 내부팀 및 안전 파트너와 함께 일할 예정이다.
- 접근 권한: 직원과 비슷한 수준의 접근을 표방하지만 열람 가능한 자료의 목록, 접근 거부 시 대응 절차와 정보 완전성 검증 권한은 공개되지 않았다.
- 결과 공개: 사고 보고와 대중 설명이라는 방향은 제시됐으나 보고서 공개 의무, 발행 주기, 원문 보존, Anthropic의 사전 검토 권한은 확인되지 않았다.
- 자금 관계: Anthropic이 Accenture의 평가 업무를 직접 지원한다. 계약액, 보수 산정 방식과 계약 종료로부터 평가 판단을 보호할 조항은 발표되지 않았다.
따라서 이번 ‘독립 평가’를 규제기관의 감사나 법정 인증과 동일하게 볼 수는 없다. 현재 공개된 형태는 기업이 외부 조직을 개발 과정 안으로 들여오는 자발적 운영 모델이다. 평가자 자격, 필수 접근 범위, 보고 규칙과 외부 감독이 통일된 제도로 확립된 상태는 아니다.
평가팀의 성패는 공개 권한에서 갈린다
이번 협력은 비독점적이다. Anthropic은 앞으로 다른 평가자를 추가할 계획이고, Accenture도 다른 AI 개발사와 비슷한 역할을 수행할 수 있다는 방침이다. Anthropic은 METR 등 비영리 평가기관과 자체 자금을 이용한 내장형 평가 요소의 시험도 논의하고 있다.
평가자가 여러 곳으로 늘어나면 단일 기관의 관점과 계약 관계에 의존하는 위험을 낮출 가능성이 있다. 그러나 평가자마다 접근 정보와 공개 기준이 다르면 결과를 서로 비교하기 어렵다. 평가자 수보다 중요한 것은 공통 최소 기준, 불리한 결과를 포함한 공개 권한, 그리고 피평가 기업 한 곳에 의존하지 않는 자금 구조다.
현재 확정된 것은 합계 최소 20억 달러의 5년 투자 계획, Faculty에 예정된 업무 범위, 직원급 접근이라는 원칙, Anthropic의 직접 비용 부담이다. 팀 규모, 실제 업무 개시일, 최초 평가 대상 모델과 첫 공개 보고서의 형식·시점은 발표되지 않았다. 이 공백이 채워져야 내장형 평가가 깊은 접근을 갖춘 독립 검증인지, 기업이 비용과 범위를 관리하는 외부 자문인지 판단할 수 있다.
함께 읽기:
관련 기사
뉴스레터 구독
최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.




