AI 및 자동화

Muse Voice Transcribe는 20명 넘게 구분한다…시간당 0.18달러

|작성자: QUASA 편집팀|4 분 소요| 1
Muse Voice Transcribe는 20명 넘게 구분한다…시간당 0.18달러

Meta Superintelligence Labs가 2026년 9월 1일 실시간 오디오 인식 모델 Muse Voice Transcribe를 출시했다. Meta의 공식 기술 소개 에 따르면 이 모델은 스트리밍 자동 음성 인식(ASR), 20명 넘는 화자의 분리, 발화 종료 감지를 하나의 생성 흐름에서 처리하며 Meta Model API를 통해 이날부터 이용할 수 있다.

Muse Voice Transcribe는 같은 날 Meta AI for Mac과 Muse Code의 음성 입력에도 적용됐다. 9to5Mac의 출시 당일 보도 는 API 요금이 오디오 1,000분당 3달러, 환산하면 1시간당 0.18달러라고 확인했다. 개발자가 살펴볼 핵심은 이 낮은 처리 단가뿐 아니라 한국어 검증 범위와 실시간 화자 구분 방식이다.

ASR·화자 분리·발화 종료를 한 모델에서 처리한다

Muse Voice Transcribe가 다화자 대화를 화자별 문장과 발화 종료 구간으로 동시에 처리하는 과정

Muse Voice Transcribe는 음성을 먼저 문자화하고 별도 시스템으로 화자를 다시 분류하는 전통적인 파이프라인과 구조가 다르다. 텍스트를 생성하는 과정에 화자 전환과 발화 경계 정보가 함께 들어가므로 애플리케이션은 발언 내용, 발언자, 발화 종료 신호를 같은 스트림에서 받을 수 있다.

화자 분리에는 잠재적인 발언자 전환을 표시하는 시작 토큰과 발언자를 구별하는 태그가 쓰인다. 모델은 발언자가 바뀌는 시점을 먼저 표시하고 해당 구간이 끝날 때 화자 태그를 결정한다. 같은 사람의 발화가 여러 구간으로 나뉘더라도 동일한 태그를 유지하도록 학습됐다.

발화 종료 감지 역시 특수 토큰으로 구현됐다. 모델은 음성이 시작된 지점과 사용자가 말을 끝낸 지점을 각각 표시한다. 음성 에이전트는 이 신호를 이용해 사용자의 말이 끝났는지 판단할 수 있지만, 종료 감지가 실제 응답 생성이나 대화 제어까지 대신하는 것은 아니다.

공개된 기능 범위는 다음과 같다.

  • 스트리밍 ASR: 녹음이 끝나기 전부터 들어오는 음성을 순차적으로 문자화한다.
  • 화자 분리: 20명이 넘는 발언자를 추적하고 각 발화 구간에 화자 태그를 붙인다.
  • 발화 종료 감지: 음성의 시작과 끝을 출력에 포함해 대화 시스템이 발언 경계를 파악하도록 한다.
  • 장시간 문맥: 1시간을 넘는 오디오와 다수 화자를 필수 후처리 없이 다루도록 설계됐다.

여기서 ‘20명 넘게 구분한다’는 표현은 출시 자료에 적힌 20명 이상 규모의 화자 분리 지원 범위를 가리킨다. 모든 회의 조건에서 20명이 넘는 참석자를 완벽하게 식별한다는 정확도 보장은 아니다. 실제 결과는 중첩 발화, 녹음 품질, 참가자의 목소리 유사도 같은 입력 조건에 영향을 받을 수 있다.

80밀리초 청크와 적응형 지연으로 실시간 출력을 만든다

Muse Voice Transcribe가 80밀리초 단위 음성을 받아 단어 난도에 따라 출력 시점을 조절하는 과정

모델은 들어오는 오디오를 80밀리초 단위, 초당 12.5개의 청크로 나누며 각 청크를 하나의 소프트 토큰으로 변환한다. 청크를 받을 때마다 다음 오디오를 더 들을지 텍스트 토큰을 출력할지 결정한다. 스트림이 끝나면 오디오 입력 종료를 알리는 별도 토큰을 받은 뒤 남은 텍스트를 생성한다.

핵심은 모든 단어에 똑같은 대기 시간을 적용하지 않는 적응형 지연이다. 비교적 쉽게 확정할 수 있는 단어는 빠르게 출력하고, 문맥이 더 필요한 단어는 추가 오디오를 기다린다. 오래 들을수록 인식에 쓸 문맥은 늘지만 화면에 최종 문장이 나타나는 시간도 길어지는 상충 관계를 단어별로 조절하는 방식이다.

이 동작은 단어 오류율 보상과 지연 보상을 함께 사용하는 강화학습으로 구현됐다. 따라서 개발자가 모든 입력에 하나의 고정 지연값을 지정하는 것과 달리 모델이 단어의 난도에 따라 기다리는 시간을 바꾼다. 다만 ‘적응형’은 무지연을 의미하지 않으며 발음, 문맥과 입력 품질에 따라 최종 확정 시점이 달라질 수 있다.

회의 자동화에서는 녹음 파일 전체를 올린 뒤 결과를 받는 배치 방식과 차이가 생긴다. 참석자가 말하는 동안 텍스트와 화자 정보가 생성되고 발화 종료 상태도 이어서 전달되기 때문이다. 실시간 자막, 회의록 초안이나 음성 에이전트처럼 발언 도중부터 결과를 소비하는 서비스에 맞춘 구조다.

70개 이상 학습과 25개 검증은 구분해야 한다

언어 범위에는 서로 다른 두 숫자가 쓰인다. 모델 학습에는 70개가 넘는 언어가 포함됐지만, 출시 시점에 광범위하게 검증된 언어는 25개다. 70개 이상은 학습 데이터의 범위이고 25개는 초기 출시에서 Meta가 우선 사용을 권한 검증 범위이므로 모든 학습 언어가 같은 수준으로 평가됐다고 볼 수 없다.

디지털투데이가 확인한 검증 언어 에는 한국어와 영어, 일본어, 중국어, 스페인어 등이 포함된다. 모델은 한 문장 안이나 문장 사이에서 언어가 바뀌는 코드 스위칭을 기본 지원하며 언어, 키워드와 문맥 정보를 미리 제공해 인식 결과를 조정하는 바이어싱 기능도 갖췄다.

한국어가 25개 언어에 포함됐다는 사실은 단순히 학습에 사용됐다는 것보다 강한 지원 신호다. 그러나 공개된 출시 자료에는 한국어만을 대상으로 한 단어 오류율이나 지역별 억양, 회의실 소음, 중첩 발화 조건별 결과가 따로 제시되지 않았다. 한국어 지원 여부와 특정 업무 환경에서 요구되는 정확도는 별개의 문제다.

국내 회의에서는 사람 이름과 회사명, 제품명, 날짜, 숫자, 영문 약어가 한 발언에 섞이는 경우가 많다. 키워드와 문맥 바이어싱은 이런 어휘를 사전에 제시하는 수단이지만 모든 고유명사와 수치를 오류 없이 기록한다는 보장은 아니다. 중요한 회의록에서 원본 음성과 결과를 대조해야 하는 이유다.

1,000분당 3달러지만 전체 운영비는 별도다

Muse Voice Transcribe API의 1,000분당 3달러 요금을 1시간당 0.18달러로 환산한 사용 기록

출시 시점의 Meta Model API 요금은 처리한 오디오 1,000분당 3달러다. 분당 0.003달러이므로 60분에는 0.18달러가 된다. 한 달에 100시간을 처리한다고 가정하면 모델의 음성 처리 요금은 18달러다.

이 계산에는 애플리케이션 서버, 오디오 저장 공간, 네트워크, 후속 요약 모델, 사용자 인증과 운영 인력 비용이 포함되지 않는다. 공개된 금액은 음성 처리 자체의 API 단가이며 실제 서비스 원가와 같지 않다. 계정별 이용 가능 지역, 사용 한도와 향후 가격 변경 가능성도 별도로 확인해야 한다.

출시 당시 확인된 제공 경로는 Meta Model API, Meta AI for Mac, Muse Code다. Mac에서는 Fn 키를 누른 채 말해 다른 애플리케이션에 받아쓰는 방식으로 사용할 수 있다. 개발자가 회의 서비스나 음성 에이전트에 연결할 때는 모델 가중치를 내려받는 방식이 아니라 호스팅 API를 호출하는 경로가 공개돼 있다.

현재까지 확정된 내용은 한국어가 25개 검증 언어에 포함되고, 실시간 ASR과 20명 넘는 화자 분리, 발화 종료 감지가 하나의 모델로 제공된다는 점이다. 반면 한국어 회의 조건별 정확도, 동시 발화에서의 화자 태그 안정성, 바이어싱 적용 전후의 개선 폭은 공개 자료만으로 판단할 수 없다. 출시 이후에는 한국어 평가 결과와 API의 지역별 접근 조건, 요금 및 지원 언어 변경 여부가 추가로 확인돼야 한다.

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0