Grok Voice Transcribe 2.0 dẫn đầu streaming, nhưng batch chỉ đứng thứ năm

Ngày 18/9/2026, SpaceXAI phát hành Grok Voice Transcribe 2.0; phân tích benchmark của RuntimeWire ghi nhận mô hình đạt WER 2,7% cho bản chép streaming cuối, đứng đầu về độ chính xác trong phép đo được dẫn, với độ trễ 0,49 giây, trong khi kết quả batch đạt WER 2,3% nhưng chỉ xếp thứ năm.
Thông báo sản phẩm của SpaceXAI ấn định giá 0,10 USD cho mỗi giờ batch và 0,20 USD cho mỗi giờ streaming, bằng giá phiên bản 1.0; mô hình hỗ trợ hàng chục ngôn ngữ, còn phiên bản cũ dự kiến bị ngừng trong những tuần tiếp theo. Như vậy, ưu thế rõ nhất của bản mới nằm ở độ chính xác khi phiên âm trực tiếp, nhưng kết quả đó không chứng minh đây là lựa chọn chính xác nhất cho tệp ghi âm ngoại tuyến.
Dẫn đầu streaming không có nghĩa là phản hồi nhanh nhất
WER, hay tỷ lệ lỗi từ, đo tỷ lệ từ bị thay thế, bỏ sót hoặc chèn sai so với bản chép chuẩn. Chỉ số càng thấp thì bản chép càng sát nội dung tham chiếu, nhưng WER không đo thời gian người dùng phải chờ kết quả.
Trong chế độ streaming, âm thanh được chuyển đến mô hình theo từng phần khi người nói vẫn đang tiếp tục. Hệ thống có thể trả bản chép tạm thời, sửa lại nội dung dựa trên ngữ cảnh mới rồi mới xác nhận bản cuối sau khi phát hiện lượt nói đã kết thúc.
Vì vậy, first-final latency và WER trả lời hai câu hỏi khác nhau. Chỉ số thứ nhất cho biết hệ thống mất bao lâu để đưa ra bản chép cuối sau điểm kết thúc lời nói; chỉ số thứ hai cho biết bản chép đó sai bao nhiêu. Grok đứng đầu tiêu chí sai số trong nhóm streaming được thử, nhưng một số đối thủ trả kết quả sớm hơn với mức lỗi cao hơn đôi chút.
Sự đánh đổi này đặc biệt đáng chú ý với voice agent: thời gian chờ bản chép làm giảm phần thời gian còn lại cho mô hình suy luận, gọi công cụ và tạo câu trả lời. Đối với phụ đề trực tiếp, độ trễ cũng có thể khiến dòng chữ xuất hiện muộn hơn lời nói dù nội dung cuối chính xác hơn.
Batch xếp hạng riêng vì nhận toàn bộ tệp âm thanh
Batch là một bài toán khác: mô hình được tiếp cận toàn bộ bản ghi trước khi hoàn tất kết quả, thay vì phải cập nhật lời thoại theo thời gian thực. Điều đó giải thích vì sao WER batch có thể thấp hơn WER streaming của cùng sản phẩm mà vị trí xếp hạng lại kém hơn.
Tại thời điểm kiểm tra ngày 20/9/2026, bảng non-streaming của Artificial Analysis đặt Grok Voice Transcribe 2.0 ở vị trí thứ năm với AA-WER 2,3%; bốn vị trí phía trên lần lượt thuộc Fun-Realtime-ASR-preview và StepAudio 3 ASR cùng đạt 1,7%, MAI-Transcribe-2 đạt 2,0% và ElevenLabs Scribe v2 đạt 2,2%.
AA-WER là điểm tổng hợp từ khoảng tám giờ âm thanh thuộc ba tập dữ liệu. AA-AgentTalk, tập riêng tập trung vào lời nói hướng đến voice agent, chiếm một nửa trọng số; VoxPopuli-Cleaned-AA và Earnings22-Cleaned-AA chia đều phần còn lại. Bảng xếp hạng nhờ đó tạo ra điều kiện chung để so sánh mô hình, nhưng không đại diện cho mọi loại bản ghi, giọng địa phương hoặc môi trường âm thanh.
“Chính xác gấp đôi” có phạm vi rộng hơn benchmark công khai
Cụm từ “chính xác gấp đôi” là cách SpaceXAI tổng hợp các đánh giá thực tế của riêng công ty, không phải kết luận trực tiếp từ một bảng xếp hạng độc lập duy nhất. Các nhóm đánh giá nội bộ bao gồm âm thanh điện thoại chăm sóc khách hàng, hội thoại với Grok, mã tài khoản và địa chỉ email được đọc thành tiếng, cùng câu lệnh ngắn đa ngôn ngữ.
Benchmark công khai xác nhận một kết luận hẹp hơn: phiên bản mới giảm lỗi đáng kể so với phiên bản trước trong cả phép đo streaming và batch được dẫn. Tuy nhiên, mức cải thiện thay đổi theo chế độ và tập âm thanh, nên “gấp đôi” không đồng nghĩa số lỗi luôn giảm một nửa với mọi ngôn ngữ, giọng nói hoặc điều kiện thu âm.
Sự khác biệt này không làm kết quả streaming mất giá trị. Nó chỉ giới hạn cách diễn giải: vị trí dẫn đầu áp dụng cho một phương pháp đo cụ thể, còn tuyên bố rộng hơn về độ chính xác phụ thuộc một phần vào dữ liệu nội bộ chưa được công bố đầy đủ.
Hỗ trợ tiếng Việt chưa đi kèm điểm WER riêng
Khả năng nhận diện hàng chục ngôn ngữ, tự động xác định ngôn ngữ và theo dõi việc chuyển ngôn ngữ trong cùng bản ghi cho thấy phạm vi sử dụng rộng hơn bản tiếng Anh đơn ngữ. Sản phẩm cũng có các chức năng như mốc thời gian theo từ, phân tách người nói, xử lý nhiều kênh, ưu tiên thuật ngữ, định dạng số và phát hiện kết thúc lượt nói.
Tuy nhiên, tài liệu ra mắt không tách riêng WER cho tiếng Việt. Việc một ngôn ngữ nằm trong phạm vi hỗ trợ chỉ xác nhận mô hình có thể xử lý ngôn ngữ đó; nó không chứng minh chất lượng tiếng Việt tương đương điểm tổng hợp của benchmark hay kết quả trên các tập tiếng Anh.
Hai bảng đo dẫn đến hai kết luận khác nhau
Grok Voice Transcribe 2.0 hiện kết hợp giá thấp với kết quả chính xác nhất trong phép đo streaming được công bố khi ra mắt. Đổi lại, độ trễ của bản chép cuối không phải thấp nhất, còn bài batch đặt mô hình sau bốn đối thủ dù tỷ lệ lỗi của nó tốt hơn thế hệ trước.
Những dữ liệu vẫn còn thiếu gồm benchmark độc lập dành riêng cho tiếng Việt, kết quả trên âm thanh điện thoại tại Việt Nam và ngày ngừng hoạt động cụ thể của phiên bản 1.0. Cho đến khi có thêm phép đo, vị trí dẫn đầu streaming và hạng năm batch cần được hiểu trong phạm vi từng bảng, còn tuyên bố “chính xác gấp đôi” vẫn là kết luận của SpaceXAI từ tổ hợp đánh giá riêng.
Đọc thêm:
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.