
Anthropic 안에 Accenture 평가팀이 들어간다…독립성 기준은 미정

Anthropic과 Accenture는 2026년 9월 18일 Accenture 인력이 Anthropic 내부에서 프런티어 AI 모델을 검증하는 내장형 평가팀 구성 계획을 발표했다. Anthropic의 파트너십 발표 는 평가자에게 직원과 비슷한 수준의 접근권을 제공하고, 훈련 중인 모델과 개발·배포 결정을 관찰하며 내부 직원과 직접 소통하게 할 방침이라고 밝혔다.
평가 실무는 Accenture의 전문 AI 사업부 Faculty가 이끌며 모델 평가, 레드팀, 정렬 평가와 안전장치 시험을 맡을 예정이다. 2026년 9월 18일 나온 Reuters 보도 도 이 업무 범위와 양사가 향후 5년간 각각 최소 10억 달러를 투입할 것으로 예상한다는 내용을 확인했다. 다만 이는 앞으로 운영할 팀에 관한 발표로, 평가가 시작됐거나 결과가 나온 단계는 아니다.
직원 수준 접근은 약속됐지만 경계는 정해지지 않았다
내장형 평가의 차이는 완성된 모델만 외부에서 시험하는 대신 모델이 만들어지는 과정에 평가자가 들어간다는 데 있다. 훈련 단계의 변화를 지켜보고 개발 및 배포 결정의 배경을 추적할 수 있다면 출시 직전 시험만으로는 드러나기 어려운 사각지대와 안전 약속의 이행 여부를 더 일찍 확인할 여지가 생긴다.
그러나 직원과 ‘비슷한’ 접근권이 모든 내부 시스템과 자료에 대한 무제한 열람을 뜻하지는 않는다. 공개된 내용만으로는 어떤 모델 체크포인트, 훈련 기록, 평가 로그와 의사결정 자료까지 볼 수 있는지 알 수 없다. 접근 기간, 기밀정보 취급 방식, 보안상 열람할 수 없는 영역을 누가 결정하는지도 제시되지 않았다.
접근권과 외부 소통에 적용할 공통 표준이 아직 없다는 점은 TechCrunch의 당일 보도 에서도 확인된다. 따라서 이번 발표가 확정한 것은 내부에서 평가할 방향과 업무 종류다. 평가자가 실제로 행사할 권한의 범위나 Anthropic의 결정에 이의를 제기하는 절차까지 합의된 것은 아니다.
평가팀의 업무는 네 갈래다
공개된 업무는 모델 평가, 레드팀, 정렬 평가, 안전장치 시험으로 나뉜다. 모델 평가는 성능과 위험을 측정하고, 레드팀은 의도적으로 취약한 행동을 유도해 실패 가능성을 찾는다. 정렬 평가는 모델의 행동이 정해진 목표와 안전 원칙에 부합하는지 살피며, 안전장치 시험은 이미 적용된 제한이 예상대로 작동하는지를 확인한다.
다만 업무의 이름만으로 평가 결과가 실제 출시 결정에 어떤 영향을 주는지는 알 수 없다. 레드팀이 심각한 실패를 발견했을 때 출시가 자동으로 보류되는지, 보완과 재시험을 요구할 권한이 있는지, 최종 판단이 Anthropic에 남는지는 공개되지 않았다. 발견 사항의 심각도 분류와 재시험 조건, 이견을 기록하는 방식도 향후 운영 규칙이 필요한 부분이다.
Faculty가 맡은 이유로는 기업과 정부의 실제 AI 도입 환경에 대한 경험이 제시됐다. 이런 경험은 연구실의 통제된 시험을 넘어 실제 배포 조건에서 발생할 위험을 평가하는 데 도움이 될 수 있다. 그러나 산업 경험은 전문성의 근거일 뿐 독립성의 증거는 아니다. 평가 대상과 방법을 스스로 정할 수 있는지, 불리한 결론을 수정 압력 없이 유지할 수 있는지는 별개의 문제다.
각각 10억 달러는 평가 계약 금액이 아니다
양사는 향후 5년간 각각 최소 10억 달러를 투입할 것으로 예상한다. 두 금액을 단순 합산하면 최소 20억 달러지만, 공개 문구의 범위에는 차이가 있다. Anthropic은 이 분야의 역량 구축을, Accenture는 AI 안전을 투자 대상으로 표현했다. 따라서 전체 금액이 이번 평가팀의 인건비나 계약 대가로 배정됐다고 해석할 근거는 없다.
평가 업무의 구체적인 계약 금액과 지급 조건은 공개되지 않았다. 확인된 자금 구조는 Anthropic이 Accenture의 평가 업무 비용을 직접 부담한다는 점이다. 장기적으로는 공동기금이나 정부 재원을 이용하는 방안이 제시됐지만 현재 그런 체계가 마련되지 않아 직접 지급 방식을 택했다.
피평가 기업이 비용을 낸다는 사실만으로 평가 결과가 무효가 되는 것은 아니다. 다만 보수와 계약 갱신을 누가 결정하는지, 업무 범위를 누가 바꿀 수 있는지, 불리한 결과가 나왔을 때 계약 종료가 보고를 막을 수 있는지는 이해충돌을 판단하는 핵심 조건이다. 이 조건들은 현재 공개된 발표에서 확인되지 않는다.
파트너십은 비독점 방식이다. Anthropic은 다른 평가기관도 추가할 계획이며, METR을 비롯한 비영리 평가기관과는 각 기관의 자체 재원을 활용한 내장형 평가 요소의 시범 운영을 논의하고 있다. Accenture도 다른 AI 개발사에서 비슷한 역할을 수행할 수 있다. 복수 평가자가 참여하면 관점의 편중을 줄일 수 있지만, 서로 다른 접근권과 자금 조건을 적용받는다면 결과를 같은 기준으로 비교하기 어렵다.
독립성은 접근보다 보고권에서 갈린다
깊은 접근권과 독립적인 판단은 같은 조건이 아니다. 내부 자료를 폭넓게 볼 수 있어도 조사 대상과 일정이 피평가 기업에 의해 제한되거나 결론을 외부에 전달할 권한이 없다면 검증 가능성은 낮아진다. 반대로 접근 범위와 보고 절차를 사전에 정하고 불리한 발견에도 동일한 규칙을 적용한다면 직접 비용 지급에서 생기는 이해충돌을 줄일 수 있다.
현재 발표는 평가자가 안전 약속의 이행을 확인하고 사각지대를 찾으며 사건을 보고할 수 있다는 역할을 제시한다. 그러나 Accenture가 Anthropic의 사전 승인 없이 결과를 공개할 수 있다는 규정은 공개되지 않았다. 누구에게 먼저 보고하는지, 보안이나 영업비밀을 이유로 공개가 제한될 때 누가 최종 판단하는지, 원문 보고서와 요약본 가운데 무엇을 공개할지도 알 수 없다.
독립성을 외부에서 판단하려면 네 축이 함께 드러나야 한다. 첫째는 평가자가 실제로 열람할 수 있는 정보, 둘째는 평가 대상과 방법을 정하는 권한, 셋째는 보수·갱신·종료를 포함한 자금 조건, 넷째는 발견 사항과 반대 의견을 외부에 알리는 규칙이다. 현재 확인된 것은 직원 수준에 준하는 접근 방향과 네 가지 평가 업무, Anthropic의 직접 비용 부담이다. 각 축을 연결하는 공동 기준은 아직 미정이다.
다음 발표에서 확인돼야 할 항목
평가팀의 인원과 실제 업무 시작일, 첫 평가 대상 모델은 공개되지 않았다. ‘내부에서 일한다’는 표현이 물리적 상주와 기술적 접근을 각각 어떻게 포함하는지, 평가 기간이 특정 모델 개발 주기에 한정되는지도 불분명하다.
- 모델 체크포인트, 훈련 기록, 평가 로그와 내부 결정 자료를 포함한 구체적인 접근 범위
- 평가 대상과 시험 방법을 Faculty가 독자적으로 선택할 수 있는 조건
- 중대한 발견을 경영진, 감독기관과 대중에게 보고하는 순서와 기한
- Anthropic의 사전 승인 없이 결과나 반대 의견을 공개할 수 있는 범위
- 보수, 계약 갱신과 종료가 평가 판단에 영향을 주지 않도록 하는 이해충돌 절차
- 여러 평가기관이 결과를 비교하고 재현할 수 있도록 하는 공통 기준
현재 확정된 것은 두 회사가 내장형 평가팀을 구성하기로 했고 Faculty가 모델 평가, 레드팀, 정렬 평가와 안전장치 시험을 맡는다는 계획이다. 직원 수준의 접근은 기존 외부 평가보다 개발 과정을 가까이 볼 가능성을 열지만, 팀의 실제 투입과 첫 평가 결과 공개는 이뤄지지 않았다. 독립성을 판단할 다음 근거는 접근 규칙, 계약상 이해충돌 장치와 외부 보고권이 구체적인 기준으로 공개되는지다.
함께 읽기:
관련 기사
뉴스레터 구독
최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.




