과학자는 AI로 주 7시간을 아꼈다…실험 병목은 더 커졌다

|작성자: QUASA 편집팀|5 분 소요| 2
과학자는 AI로 주 7시간을 아꼈다…실험 병목은 더 커졌다

Google은 2026년 9월 15일 Google DeepMind·MIT FutureTech와 진행한 과학자 AI 이용 연구를 공개했다. Google의 ATLAS 업데이트 에 따르면 미국과 영국 과학자 600명 이상은 AI로 주당 7시간에 가까운 시간을 아꼈다고 답했으며, 약 절반은 어떤 형태로든 AI를 매일 사용했다.

같은 연구가 포착한 결과는 단순한 생산성 향상이 아니었다. 분석·코딩·문헌 검토와 가설 생성은 빨라졌지만 물리 실험, 현장 데이터 수집과 임상 검증은 같은 속도로 확장되지 않았다. 제목의 ‘병목이 더 커졌다’는 표현은 연구 전체의 처리시간을 직접 측정했다는 뜻이 아니라, 상당수 응답자가 후속 단계로 제약이 이동하고 미검증 가설이 늘었다고 보고한 현상을 가리킨다.

6.9시간은 실험으로 측정한 성과가 아니다

공동 연구진의 원문 보고서 에 따르면 More in Common은 2026년 7월 27일부터 8월 11일까지 미국 379명과 영국 258명 등 현직 과학자 637명을 온라인으로 조사했고, 응답자들이 추정한 순절감 시간은 주당 평균 6.9시간이었다. 약 47%는 AI를 매일, 31%는 매주 사용한다고 답했으며, 응답자의 약 4분의 3은 순시간 절감을, 6%는 순시간 증가를 보고했다.

따라서 6.9시간은 시스템 로그로 확인한 실제 근무시간 감소나 무작위 대조시험의 결과가 아니다. 연구진도 과학자 전체를 대표하는 모집단 명부가 없어 전문 패널에서 선별한 비확률 표본을 사용했고, 결과에 가중치와 오차범위를 제시하지 않았다고 밝혔다. AI를 자주 쓰는 연구자가 조사에 더 많이 참여했을 가능성도 남는다.

절약분이 모두 여가나 추가 연구시간으로 바뀐 것도 아니다. 응답자들은 산출량 확대, 물리 실험과 데이터 수집, 더 어려운 문제, 일과 삶의 균형, 교육·행정 등에 시간을 나눠 썼다. ‘주 7시간 절감’과 ‘주 7시간 추가 성과’는 같은 지표가 아니다.

세 자료는 서로 다른 장면을 보여준다

연구진은 설문만으로 결론을 만들지 않았다. 2026년 4월 초 Gemini 앱·AI Mode·API에서 표본 추출한 약 1,500만 건의 비식별 상호작용, 2012년 이후 공개된 과학용 전문 AI 모델 2,690개, 과학자 설문을 MIT FutureTech의 과학 업무 분류 체계에 맞춰 분석했다. 상호작용 표본에서는 비업무·교육용 대화 등을 걸러 약 36만 건을 과학 관련 이용으로 분류했다.

그러나 이 자료들은 한 집단의 연구성과를 처음부터 끝까지 추적한 연속 기록이 아니다. Gemini 로그는 과학 업무일 가능성이 큰 상호작용을 분류한 것이어서 사용자가 실제 과학자인지 직접 확인할 수 없고, 기업 계약에 따른 유료 Gemini API 이용도 빠졌다. 전문 모델 목록 역시 공식 논문과 코드 저장소에 연결된 비교적 잘 알려진 모델을 중심으로 만든 작업 중 데이터셋이어서 전체 과학용 AI의 등록부로 볼 수 없다.

설문은 연구자가 체감한 시간과 병목을, 로그는 Google 서비스에서 나타난 이용 양상을, 모델 목록은 공개된 전문 도구의 분포를 보여준다. 이 세 자료를 결합하면 AI가 과학 업무의 어디에 쓰이는지는 넓게 볼 수 있지만, AI가 논문이나 발견을 얼마나 늘렸는지를 직접 계산할 수는 없다.

LLM과 전문 모델은 다른 구간을 맡았다

대규모언어모델과 전문 모델은 같은 일을 놓고 경쟁하기보다 서로 다른 연구 업무를 보완하는 양상을 보였다. Gemini 같은 범용 LLM은 연구 코드 작성과 문제 해결, 통계 분석, 문헌 검토, 원고 작성 등 여러 분야에 공통적인 업무에 널리 쓰였다. 전문 모델은 질병 결과 예측, 분자 구조 설계, 데이터 생성·분류와 복잡한 시뮬레이션처럼 분야별 입력과 평가 기준이 뚜렷한 작업에 상대적으로 집중됐다.

이 분업은 시간 절감과 실험 병목이 동시에 나타난 이유를 설명한다. 디지털 환경에서는 코드, 분석 후보와 가설을 낮은 추가 비용으로 빠르게 만들 수 있지만, 예측된 단백질 기능이나 물질 특성을 확인하려면 실제 시료를 만들고 적절한 환경에서 시험해야 한다. 임상 연구와 현장 조사는 참가자 보호, 규제 심사, 장비, 재료와 일정이라는 물리적 제약을 건너뛸 수 없다.

빨라진 앞단 뒤에 미검증 가설이 쌓였다

Scientific American의 독립 보도 는 응답자의 43.5%가 지난 2년간 주요 병목이 물리 실험이나 데이터 수집 같은 후속 단계로 이동했다고 답했고, 40.5%는 지난 3년간 미검증 가설이 늘었다고 답했다고 전했다. 미검증 가설이 줄었다는 응답은 24.8%였으며, 시간을 아낀 응답자의 89%는 절약분의 10%를 넘게 AI 출력 검증에 썼고 46%는 4분의 1 이상을 확인·디버깅·사실 검증에 사용했다.

이는 모든 연구실에서 병목이 악화됐다는 증거는 아니다. 병목이 같은 단계에 머물거나 앞단으로 이동했다고 답한 사람도 있었고, 설문은 장비 대기시간이나 실험 완료율을 직접 측정하지 않았다. 다만 아이디어와 계산 결과의 공급이 늘어날 때 검증 능력이 함께 커지지 않으면, 절약된 시간이 후보 선별과 오류 확인에 다시 투입될 수 있다는 구조는 드러났다.

실험 자동화도 아직 이 간극을 완전히 메우지 못한다. 자동화할 수 있는 실험의 종류가 제한적이고, 동물이나 복잡한 생물학적 환경을 다루면 난도가 높아진다. 실제 물질을 취급하는 로봇에는 소프트웨어만으로 끝나는 계산과 다른 안전 문제와 구축비용이 따른다.

논문 증가와 발견의 질은 분리해서 봐야 한다

많은 응답자가 최근 자신의 연구실이나 직업적 산출물이 늘었다고 평가했지만, 연구진은 AI 이용과 생산성 사이에서 인과관계가 아니라 연관성을 확인했다고 명시했다. 논문, 특허, 발견과 완료 프로젝트를 한데 묶은 자기평가이므로 연구의 영향력, 재현성이나 질이 같은 폭으로 개선됐다고 해석할 수 없다.

연구 질문의 방향도 변수다. AI는 데이터가 충분하고 정답 기준이 비교적 분명한 문제의 비용을 크게 낮출 수 있다. 반대로 검증이 비싸고 학습 데이터가 부족한 고위험 질문은 상대적으로 덜 유리해질 수 있어, 산출물 수가 늘더라도 과학적 경계가 같은 속도로 넓어진다고 보장할 수 없다.

한국 연구조직에 그대로 옮길 수 없는 수치다

이번 설문에는 한국 과학자가 포함되지 않았다. 국가별 연구비 구조, 장비 접근성, 임상 승인 절차와 학문 분야 구성이 다르고, Gemini 중심 로그는 조직 내부 모델이나 다른 상용·오픈소스 도구의 이용을 모두 반영하지 않는다. 주 6.9시간을 한국 연구자의 평균 절감치나 AI 도입의 보장된 효과로 사용해서는 안 되는 이유다.

현재 확인된 범위는 미국과 영국의 비대표 표본이 보고한 시간 절감과 높은 AI 이용 빈도, 그리고 검증·실험 쪽으로 이동한 제약이다. 실제 논문과 발견의 질이 장기간 어떻게 달라지는지, 실험 자동화와 검증 도구에 대한 투자가 미검증 가설의 적체를 줄이는지는 아직 입증되지 않았다. 연구진은 ATLAS를 장기 연구로 이어갈 계획이며, 후속 분석에는 자기보고가 아닌 실제 산출물과 재현성, 분야별 처리시간을 함께 추적하는 자료가 필요하다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0