
Grok 음성인식 정확도 2배 주장…독립 측정에선 오류율 8위였다

SpaceXAI의 9월 18일 출시 발표 에 따르면 Grok Voice Transcribe 2.0은 기존 1.0보다 두 배 정확하다는 회사 내부 평가를 앞세워 공개됐다. 19개 언어의 짧은 음성 명령 세트에서는 단어 오류율이 20.6%에서 6.8%로 낮아졌고, 배치와 스트리밍 요금은 각각 오디오 1시간당 0.10달러와 0.20달러로 유지됐다.
그러나 2026년 9월 20일까지 집계된 Coval의 Grok STT 독립 측정 에서는 30일 평균 단어 오류율이 4.6%로 29개 시스템 중 8위였다. 최종 전사 구간 지연시간은 평균 214ms로 27개 중 15위였으며, 측정 페이지가 모델을 ‘Grok STT’로만 표시해 이 결과를 2.0 버전의 고유 성적이라고 단정할 수는 없다.
‘두 배 정확’이 의미하는 범위
두 배라는 표현은 모든 언어와 녹음 환경에서 오류가 일률적으로 절반으로 줄었다는 뜻이 아니다. 공개 발표는 고객지원 전화, Grok 대화, 전화번호·이메일·주소 같은 구술 정보, 19개 언어의 짧은 명령 등 실제 서비스 트래픽에서 구성한 네 가지 내부 세트에서 1.0과 2.0을 비교했다고 설명한다.
구체적인 전후 수치가 공개된 다국어 짧은 명령 세트에서는 오류율이 20.6%에서 6.8%로 약 67% 감소했다. 이는 상당한 개선이지만, 짧고 문맥이 부족한 명령이라는 조건에서 얻은 결과다. 언어별 표본 수와 음원이 공개되지 않았기 때문에 한국어만의 개선 폭이나 외부 재현 가능성은 확인되지 않았다.
단어 오류율은 기준 문장과 비교해 교체·누락·삽입된 단어의 비율을 합산한다. 수치가 낮을수록 전사가 원문에 가깝다는 뜻이지만, 모든 오류의 업무상 영향이 같지는 않다. 조사 하나가 빠진 경우와 주소·주문번호·사람 이름이 틀린 경우가 지표에서는 같은 단어 단위 오류로 계산될 수 있다.
회사 발표가 인용한 별도의 Artificial Analysis 순위에서는 2.0이 32개 스트리밍 모델 가운데 정확도 1위였다. 이 결과와 Coval의 8위는 순위만 놓고 서로 모순이라고 볼 수 없다. 사용한 음원, 경쟁 모델 목록, 스트리밍 단계, 집계 기간이 다르면 같은 제품도 다른 위치에 놓인다.
Coval의 8위는 다른 질문에 답한다
Coval은 깨끗한 음성뿐 아니라 억양, 배경 잡음, 잔향, 원거리 녹음, 클리핑, 전화 코덱이 적용된 고정 음원을 공식 API에 매일 입력한다. 특정 이전 버전과 새 버전의 개선 폭을 재는 대신, 현재 제공되는 여러 업체의 엔드포인트를 같은 방법으로 비교하는 구조다.
이 측정에서 Grok STT의 4.6% 오류율은 전체 중앙값 5.5%보다 낮지만 최저치는 아니었다. 정확도 8위라는 결과는 회사가 공개한 내부 개선을 부정하지 않는다. 다만 ‘두 배 정확’이라는 문구만으로 경쟁 서비스보다 항상 정확하다고 확대 해석할 수 없다는 점을 보여준다.
지연시간도 별도의 축이다. Grok STT의 최종 구간 지연시간 214ms는 전체 중앙값과 비슷한 수준이며, 음성이 입력된 뒤 최종 전사 구간이 반환될 때까지의 시간이다. 네트워크 왕복, 후속 언어모델 처리, 음성 에이전트의 응답 생성까지 포함한 전체 체감 지연시간과는 다르다.
무엇보다 Coval 페이지는 호출한 모델의 버전 식별자를 공개하지 않는다. 따라서 4.6%와 214ms를 Grok Voice Transcribe 2.0의 확정 성적으로 쓰거나, 이를 1.0과 2.0의 직접 비교 결과로 해석하는 것은 근거가 부족하다. 제목의 8위는 버전이 특정되지 않은 Grok STT 엔드포인트의 30일 평균 순위라는 조건이 붙는다.
가격은 그대로지만 기본 모델은 이미 바뀌었다
비용 구조는 1.0과 같다. 녹음 파일이나 URL을 처리하는 배치 방식은 오디오 1시간당 0.10달러, 실시간 스트리밍은 0.20달러다. 화자 분리, 단어별 타임스탬프와 신뢰도, 핵심어 편향 기능은 기본 요금에 포함된다.
출시 발표 당시에는 2.0이 곧 기본값이 되고 1.0은 수주 안에 단계적으로 폐기될 예정이라고 안내됐다. 이후 갱신된 SpaceXAI 음성·텍스트 변환 문서 는 2026년 9월 20일 현재 모델을 생략한 요청의 기본값을 2.0으로 표시한다. 출시 노트에 남은 1.0 기본값 안내보다 실시간 제품 문서가 앞서 변경된 상태다.
모델 이름을 지정하지 않던 기존 연동은 같은 요청에도 전사 결과가 달라질 수 있다. 이전 동작을 당분간 유지해야 하는 서비스는 grok-voice-transcribe-1.0을 명시적으로 지정할 수 있고, 2.0을 고정하려면 grok-voice-transcribe-2.0을 사용하면 된다. 이는 API 형식의 대규모 변경보다 모델 기본값 전환에 가까우며, 1.0의 정확한 종료일은 아직 제시되지 않았다.
한국어 지원과 한국어 성능은 같은 말이 아니다
현재 제품 문서는 한국어 코드를 지원 언어에 포함하며, 배치와 스트리밍 전사를 모두 제공한다. 그러나 지원 여부는 한국어 단독 정확도를 입증하지 않는다. 공개된 내부 다국어 결과는 19개 언어를 하나의 짧은 명령 세트로 묶었고, 한국어별 오류율이나 표본 수를 나누어 제시하지 않았다.
Coval의 공개 조건도 한국 시장의 실제 입력을 그대로 대변하지 않는다. 측정 리전은 미국이며, 한국어 상담 통화의 8kHz 음질, 국내 주소와 상호명, 숫자 표현, 여러 화자의 겹침, 한국에서 미국 API 리전까지의 네트워크 지연을 분리한 결과는 제공하지 않는다.
따라서 국내 도입 판단에서는 같은 한국어 음원을 1.0과 2.0, 후보 경쟁 모델에 입력해 단어 오류율과 지연시간을 함께 비교해야 한다. 상담 서비스라면 주문번호·주소·고유명사처럼 업무 결과를 바꾸는 필드의 오류를 별도로 세고, 회의 전사라면 긴 발화와 화자 분리, 음성 명령이라면 짧은 문장과 주변 소음 조건을 나눌 필요가 있다.
현재 확인되는 결론은 제한적이지만 분명하다. Grok Voice Transcribe 2.0은 같은 가격으로 출시됐고 내부 세트에서 이전 버전보다 큰 정확도 향상을 보였지만, 독립 고정 음원에서 측정된 버전 미상의 Grok STT는 오류율 8위와 지연시간 15위였다. 한국어별 공개 수치와 동일 국내 음원에서의 버전 비교가 나오기 전까지 ‘두 배 정확’은 보편적인 성능 보증이 아니라 특정 내부 평가에 근거한 출시 주장으로 읽어야 한다.
함께 읽기:
관련 기사
뉴스레터 구독
최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.




