Claude가 AI 연구의 26%를 주도했다…완전 자율은 아니었다

|작성자: QUASA 편집팀|4 분 소요| 1
Claude가 AI 연구의 26%를 주도했다…완전 자율은 아니었다

Anthropic은 2026년 9월 17일 공개한 내부 자동화 지수에서, 8월 기준 Claude가 사내 AI 연구개발 업무의 26%를 ‘주도’했다고 밝혔다. AP의 9월 18일 보도 에 따르면 여기서 ‘주도’란 고수준 지시를 받은 Claude가 작업 대부분을 처음부터 끝까지 처리하되 인간의 감독을 받는 상태로, 완전 자율 연구를 뜻하지 않는다.

2026년 8월 측정에서 Claude가 인간과 ‘협업’하거나 그보다 큰 역할을 맡은 업무 비중은 90%를 넘었지만, 완전 자율로 분류된 업무는 없었다. Reuters 보도 도 26%, 90% 초과, 완전 자율 업무 없음이라는 세 결과를 함께 전했지만, 이 수치들은 외부 기관이 재현한 결과가 아니라 Anthropic이 자체 자료와 모델로 산출한 내부 추정치다.

‘주도’와 ‘자율’ 사이에는 인간 감독이 있다

Anthropic이 채택한 자동화 수준은 AL0부터 AL5까지 여섯 단계다. 이번 결과를 해석할 때 핵심은 AL3 협업, AL4 주도, AL5 자율의 경계다. AL3에서는 AI가 사람의 긴밀한 지시 아래 큰 작업 단위를 처리하고, AL4에서는 사람이 고수준 목표를 제시한 뒤 AI가 작업 대부분을 끝까지 수행하지만 감독권은 사람에게 남는다. AL5가 되려면 작업 과정에 인간이 개입하지 않아야 한다.

따라서 26%는 전체 연구의 4분의 1을 Claude가 독자적으로 결정했다는 의미가 아니다. 연구자가 목표와 성공 기준을 정하고 Claude가 구현과 실행을 대부분 맡은 뒤 사람이 중간 판단과 결과를 검토한다면 AL4에 가까울 수 있다. 연구 의제 선정부터 결과 채택까지 감독 없이 수행해야 AL5에 해당한다.

‘AI가 다음 AI를 만든다’는 표현은 Claude의 기여가 커진 흐름을 요약할 수는 있다. 그러나 이번 지수는 인간의 통제가 사라진 자기개선이나 완전 자율 연구가 실현됐다는 증거가 아니다. 자동화된 처리 범위와 연구 방향을 결정하는 권한을 구분해야 하는 이유다.

약 1만5000개 업무를 하나의 지수로 만든 방식

Anthropic의 공식 방법론 에 따르면 회사는 2026년 7월 매주 모델 연구개발 부서별 인력의 20%를 무작위로 표본 추출했고, Claude 연구 에이전트가 Slack 기록과 내부 문서를 검토해 약 1만5000개의 세부 업무를 추출했으며, 이를 542개 노드와 378개 말단 항목으로 구성된 계층형 분류표로 정리했다; 별도의 Claude 판정 모델이 각 항목에 자동화 단계를 부여했고, 직원 평가와 모델 판정의 정확한 일치율은 59%, 직원 평가자끼리의 일치율은 35%, 모델과 직원 판정이 한 단계 이내에서 일치한 비율은 97%였다.

업무의 가중치는 항목 수가 아니라 표본 직원이 각 업무에 투입한 시간을 대리 지표로 삼아 계산했다. 여러 사람이 담당한 업무일수록 지수에서 더 큰 비중을 차지하는 구조다. 이 때문에 26%는 프로젝트 수, 코드량 또는 전체 근무시간 가운데 하나를 직접 센 값이 아니라, 재구성된 업무 바구니에서 AL4 이상으로 평가된 몫을 가중 집계한 결과다.

이 지수는 Anthropic 내부의 모델 연구개발 업무를 대상으로 한 프로토타입이다. 다른 기업의 생산성이나 전체 AI 산업의 자동화율을 나타내지 않으며, 공통 표본과 동일한 판정 규칙이 없는 상태에서 연구소 간 수치를 직접 비교할 수도 없다.

Claude가 Claude의 역할을 판정한 한계

측정 대상과 주요 측정 도구가 같은 모델 계열이라는 점은 가장 큰 방법론적 제약이다. Claude가 내부 기록에서 업무를 추출하고 분류표를 만들었으며, 다른 Claude 판정 모델이 자동화 단계를 배정했다. 평가 대상과 판정 모델이 비슷한 오류를 공유하면 체계적인 과대평가나 과소평가가 남을 수 있다.

직원들이 모델이 모은 증거나 판정을 보지 않고 별도 등급을 매긴 검증 절차는 이런 위험을 일부 점검한다. 다만 정확히 같은 등급을 선택한 비율보다 한 단계 이내에서 일치한 비율이 훨씬 높다는 결과는 AL3와 AL4처럼 인접한 단계의 경계에 판단 차이가 남는다는 뜻이기도 하다.

원자료가 사내 Slack과 내부 문서에 있고 업무 추출·분류·판정에 Claude가 관여했기 때문에, 공개된 수치만으로 외부 연구자가 결과를 재현할 수는 없다. 26%는 근거 없는 숫자는 아니지만, 독립적으로 검증된 보편적 자동화율이 아니라 회사가 설계한 절차에서 나온 내부 측정값으로 읽어야 한다.

고정 업무 바구니가 포착하지 못하는 변화

지수는 같은 업무의 자동화 수준을 시간에 따라 비교하기 위해 기준 분류표를 고정했다. 이 방식은 기존 업무에서 Claude의 역할이 커지는 흐름을 추적하는 데 유리하다. 반면 연구자가 새로운 종류의 업무로 이동하거나 기존 분류에 없던 연구가 등장하면, 고정된 바구니의 상승만으로 연구개발 전체 구조의 변화를 설명하기 어렵다.

또한 자동화 단계는 업무가 얼마나 AI에 위임됐는지를 평가할 뿐, 결과의 과학적 가치나 연구 방향의 타당성을 측정하지 않는다. Claude가 실험 구현과 실행을 대부분 맡아 AL4가 되더라도 어떤 문제를 연구할지, 결과를 신뢰할 수 있는지, 후속 개발에 채택할지는 여전히 사람이 판단할 수 있다.

Anthropic은 분류표를 주기적으로 다시 만들고 수치를 새 버전으로 공개할 계획이다. 향후 수치가 올라가더라도 업무 바구니와 판정 모델이 바뀌었다면 기존 값과 단순 비교하기 어려우므로, 각 버전의 표본과 분류 기준도 함께 공개돼야 한다.

확인된 진전과 아직 확인되지 않은 것

이번 발표가 보여준 것은 Anthropic 내부 AI 연구개발에서 Claude가 사람의 감독 아래 큰 작업 단위를 맡는 비중이 상당해졌다는 사실이다. 확인되지 않은 것은 인간 없이 연구 의제와 결과를 결정하는 완전 자율 연구, 그리고 AI가 스스로 후속 모델을 만드는 재귀적 자기개선의 달성이다.

Anthropic은 여러 기관의 외부 평가자를 회사 안에 배치해 내부 절차와 시스템, 자료에 접근시키겠다는 계획도 제시했다. 실제 독립 검증이 이뤄지려면 외부 평가자가 같은 자료와 규칙으로 지수를 재현하거나 다른 모델로 교차 판정하고, 변경된 업무 바구니와 이전 버전의 차이까지 확인할 수 있어야 한다.

그 전까지 26%는 AI 연구 자동화가 빠르게 진행되고 있음을 보여주는 중요한 신호인 동시에, 자체 모델과 비공개 사내 자료에 의존한 프로토타입 지수다. 제목의 ‘주도’는 인간 감독이 남은 AL4를 뜻하며, 완전 자율인 AL5와는 분명히 구별된다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0