Claude가 AI 연구 26%를 주도했다…완전 자율화는 아직 아니다

|작성자: QUASA 편집팀|4 분 소요
Claude가 AI 연구 26%를 주도했다…완전 자율화는 아직 아니다

Anthropic은 2026년 9월 17일 내부 AI 연구개발 자동화 지표를 공개했다. Reuters가 확인한 발표 내용 에 따르면, 8월 기준 Claude가 ‘주도’한 업무는 26%였고 사람과 ‘협업’하는 단계 이상은 90%를 넘었지만 완전 자율로 분류된 업무는 없었다.

핵심은 26%가 사람 없는 연구를 뜻하지 않는다는 점이다. AP의 9월 18일 보도 도 Claude가 후속 모델 개발을 돕고 대부분의 실행을 맡더라도 높은 수준의 지시와 인간의 감독 아래 일한다고 전했다. 연구 목표 설정과 결과 승인까지 AI가 독립적으로 수행하는 단계에는 이르지 않았다.

26%, 90% 초과, 0%가 가리키는 단계는 다르다

Anthropic은 업무별 AI 관여 수준을 AL0부터 AL5까지 여섯 단계로 구분했다. AL3 ‘협업’에서는 Claude가 긴밀한 인간 지시 아래 큰 작업 단위를 처리한다. AL4 ‘주도’에서는 사람이 높은 수준의 목표를 제시하면 Claude가 업무 대부분을 처음부터 끝까지 수행하지만, 사람은 과정을 감독하고 결과를 실제로 적용할지 결정한다.

  • AL3 ‘협업’: Claude가 상당한 작업을 수행해도 새로운 문제나 주요 의사결정 지점에서는 사람이 방향을 정한다.
  • AL4 ‘주도’: Claude가 세부 실행과 예상 밖의 문제 대응까지 맡지만, 사람의 감독과 최종 승인이 남아 있다.
  • AL5 ‘완전 자율’: 사람이 일을 시작시키거나 중간에 개입하지 않아도 AI가 문제 발견부터 실행과 적용까지 맡는다.

따라서 90% 초과라는 수치는 연구 업무의 90% 이상이 무인 자동화됐다는 의미가 아니다. AL3처럼 사람이 가까이에서 방향을 잡고 Claude가 큰 작업 덩어리를 처리한 경우까지 포함한다. 26% 역시 전체 연구 성과나 새 지식의 26%를 Claude가 창출했다는 뜻이 아니라, 측정 대상 업무 가운데 AL4로 평가된 부분의 가중 비중이다.

‘주도’ 단계에도 인간의 통제 지점이 남는다

AL4의 경계는 야간 데이터 파이프라인 장애 사례에서 선명해진다. 엔지니어가 장애 알림과 수정 요청을 건네면 Claude는 로그를 조사하고 원인을 찾은 뒤 코드를 작성하고 시험할 수 있다. 추가 문제가 발생해도 스스로 처리하고, 수정 결과를 정상 데이터와 비교해 작업 내용을 정리한다.

그러나 Claude가 수정 사항을 운영 환경에 직접 배포하지는 않는다. 엔지니어가 기록과 코드 변경을 검토하고 필요한 질문을 한 뒤, 즉시 배포할지 미룰지를 결정한다. 사람이 실행 과정에서 계속 개입할 필요는 줄어들지만 어떤 문제를 맡길지, 결과를 신뢰할지, 실제 시스템에 반영할지는 여전히 인간의 몫이다.

이 구분은 ‘Claude가 다음 Claude를 만든다’는 표현에도 적용된다. Claude가 코드 작성과 실험, 분석, 연구 도구 개선 등 후속 모델 개발 과정에 참여하는 것은 확인됐다. 하지만 독자적으로 연구 의제를 선택하고 후속 시스템을 설계·검증해 출시한다는 주장은 이번 지표가 뒷받침하지 않는다.

26%는 작업 건수가 아닌 가중 내부 지표다

Anthropic의 공식 측정 보고서 에 따르면, 2026년 7월 모델 연구개발 순환에 속한 각 부서 인력의 20%를 매주 무작위로 표본 추출했다. Claude 연구 에이전트가 이들의 Slack과 내부 문서 기록을 검토해 약 1만5000개의 세부 업무를 수집했고, 이를 542개 노드와 378개 최하위 범주로 구성된 계층형 업무 목록으로 정리했다.

그다음 별도의 Claude 판정 모델이 각 범주에 자동화 등급을 부여했다. 모든 업무를 같은 비중으로 세지 않고, 표본 직원이 각 업무에 투입한 시간을 대리 지표로 사용했다. 한 직원이 한 주에 네 가지 업무를 했다면 각 업무에 0.25씩 가중치를 배분하는 방식이다.

이 때문에 26%는 단순한 작업 건수 비율도, 연구 품질이나 생산성의 측정값도 아니다. 7월의 업무 구조를 고정한 목록, 사람의 투입 시간에 기반한 가중치, Claude의 자동화 등급 판정을 결합한 Anthropic 내부 운영 지표다. 다른 연구소나 일반 기업의 자동화율로 그대로 확대해 해석할 수 없는 이유다.

Claude가 Claude를 평가했다는 한계

측정 과정에는 Claude가 업무 기록을 조사하고, 업무 체계를 구성하며, 별도의 판정 모델로 자동화 수준까지 평가했다는 한계가 있다. 평가 대상과 판정 모델이 비슷한 오류를 공유할 가능성이 있으므로, Anthropic도 다른 개발사의 모델이나 외부 제3자가 결과를 검증할 필요가 있다고 설명했다.

담당 직원들이 독립적으로 매긴 등급과 Claude 판정이 정확히 일치한 비율은 59%였고, 한 단계 이내로 일치한 비율은 97%였다. 전반적인 방향은 비슷했지만 AL3와 AL4처럼 경계에 놓인 업무에는 해석 차이가 남았다는 뜻이다. ‘협업’과 ‘주도’를 나누는 기준이 조금만 달라져도 26%라는 결과는 움직일 수 있다.

고정된 업무 목록도 변화의 일부만 포착한다. 이 방식은 7월에 존재하던 동일 업무가 시간이 지나며 얼마나 자동화되는지 비교하는 데 적합하지만, Claude 덕분에 새로 생긴 연구나 사람이 더 복잡한 업무로 옮겨간 변화는 하나의 비율에 충분히 반영하지 못할 수 있다. 업무를 얼마나 잘게 나누는지도 결과에 영향을 준다.

다음 측정이 보여줘야 할 것

이번 공개로 확인된 것은 Claude가 Anthropic 내부 AI 연구개발에서 단순 보조를 넘어 일부 업무의 실행을 주도한다는 사실이다. 동시에 문제 선택, 높은 수준의 목표 제시, 감독과 실제 적용 결정에는 사람이 남아 있다. 따라서 26%를 연구 인력 대체율이나 완전한 자기개선의 달성도로 읽을 근거는 없다.

Anthropic은 이 지표를 계속 공개하고 여러 외부 기관의 독립 평가자가 내부 절차와 데이터에 접근하도록 할 계획이다. 이후 측정에서는 같은 업무 목록과 판정 기준이 유지됐는지, 외부 평가가 내부 등급을 재현하는지, 자동화 확대가 완료 시간과 성공률·재작업 규모 같은 결과 개선으로 이어지는지가 관건이다. 현재 단계에서 분명한 결론은 Claude의 연구 역할은 커졌지만 완전 자율화는 아직 측정되지 않았다는 것이다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0