Google đạt hơn 300 ngôn ngữ, nhưng mục tiêu 1.000 còn rất xa

|Tác giả: Ban biên tập QUASA|6 phút đọc| 14
Google đạt hơn 300 ngôn ngữ, nhưng mục tiêu 1.000 còn rất xa

Ngày 15/9/2026, Google công bố các công nghệ và sản phẩm của hãng hỗ trợ tương tác bằng hơn 300 ngôn ngữ, được hơn 7 tỷ người sử dụng, tương đương 86% dân số thế giới. Moneycontrol ghi nhận cùng ngày cột mốc hơn 300 ngôn ngữ và quy mô khoảng 7 tỷ người.

Đây không phải thông báo rằng một sản phẩm Google đã cung cấp đầy đủ mọi tính năng bằng hơn 300 ngôn ngữ. Con số mô tả phạm vi tổng hợp của nhiều sản phẩm, mô hình và công nghệ; chính dữ liệu Google công bố cho thấy số ngôn ngữ thay đổi đáng kể theo từng công cụ và tác vụ.

Con số hơn 300 bao trùm nhiều sản phẩm khác nhau

Công bố chuyên đề của Google cho biết Google Translate hỗ trợ hơn 250 ngôn ngữ, Gemini 3.5 Live Translate dịch lời nói theo thời gian thực ở 70 ngôn ngữ và hơn 2.000 cặp ngôn ngữ, còn TranslateGemma được huấn luyện trên 55 ngôn ngữ. Mô hình Sign Language-to-Text được huấn luyện với hơn 50 ngôn ngữ ký hiệu, ban đầu hỗ trợ chuyển Ngôn ngữ ký hiệu Mỹ sang tiếng Anh trong Gboard và Live Transcribe trên Pixel 11.

Các phạm vi khác nhau giải thích vì sao không thể đọc “hỗ trợ hơn 300 ngôn ngữ” như một danh sách tính năng thống nhất. Một ngôn ngữ có thể có trong dịch văn bản nhưng chưa xuất hiện ở dịch lời nói trực tiếp, phiên âm, nhận dạng chuyển mã hoặc công cụ dành cho ngôn ngữ ký hiệu.

Google cũng chưa đưa ra trong đợt công bố này một bảng đối chiếu cho biết từng ngôn ngữ được hỗ trợ ở sản phẩm nào, với chức năng và mức chất lượng cụ thể ra sao. Bởi vậy, con số hơn 300 xác nhận độ phủ của cả hệ sinh thái, nhưng chưa chứng minh trải nghiệm tương đương giữa các ngôn ngữ.

Dữ liệu ít là nút thắt của những ngôn ngữ bị bỏ sót

Google xác định sự tập trung của nội dung web vào một số ngôn ngữ lớn là một trở ngại đối với những ngôn ngữ ít tài nguyên. Văn bản trực tuyến cũng không đủ để phản ánh đầy đủ giọng địa phương, nhịp nói, cảm xúc, tiếng lóng hoặc cách người dùng chuyển đổi giữa nhiều ngôn ngữ trong cùng cuộc trò chuyện.

Để bổ sung dữ liệu, hãng hợp tác với các trường đại học, chuyên gia và cộng đồng địa phương. Các chương trình được nêu gồm WAXAL tại châu Phi cận Sahara, Project Vaani tại Ấn Độ và Amplify Initiative trên nhiều châu lục; dữ liệu thu thập không chỉ có văn bản mà còn gồm tiếng nói, hình ảnh và những đặc trưng giao tiếp gắn với địa phương.

Cách tiếp cận này cho thấy số người nói đông không tự động tạo ra dữ liệu huấn luyện đủ đại diện. Chất lượng của một hệ thống còn phụ thuộc vào phương ngữ, môi trường âm thanh, nhóm người tham gia, loại tác vụ và cách dữ liệu được kiểm định — những yếu tố không thể hiện trong tổng số ngôn ngữ.

Mục tiêu 1.000 còn thiếu cả số lượng lẫn thước đo chất lượng

Bài tổng hợp chính thức của Google đặt mục tiêu hỗ trợ 1.000 ngôn ngữ được sử dụng nhiều nhất thế giới, đồng thời cho biết hơn một tỷ người dịch khoảng một nghìn tỷ từ mỗi tháng. Tuy nhiên, Google chưa nêu thời hạn hoàn thành hoặc tiêu chuẩn chung để xác định khi nào một ngôn ngữ được xem là đã được hỗ trợ đầy đủ.

Khoảng cách từ hơn 300 tới 1.000 vì thế không chỉ là gần 700 ngôn ngữ chưa được bổ sung. Google còn phải mở rộng dữ liệu, đưa khả năng ngôn ngữ vào từng sản phẩm và đánh giá chất lượng cho các tác vụ khác nhau. Universal Speech Model, được huấn luyện trên 12 triệu giờ âm thanh, dùng học chuyển giao xuyên ngôn ngữ để tận dụng mẫu từ ngôn ngữ giàu dữ liệu cho ngôn ngữ ít dữ liệu hơn, nhưng phương pháp đó tự thân không chứng minh chất lượng đã ngang nhau.

Các bài công bố cũng chưa hoàn toàn nhất quán về cách diễn đạt: phần mở đầu của bài tổng hợp nói “hơn 300”, trong khi một đoạn bên dưới dùng “gần 300”. Thông báo chuyên đề về ngôn ngữ và phần mở đầu đều xác nhận mốc hơn 300, nhưng sự khác biệt này càng cho thấy cần một danh mục có thể kiểm tra theo từng sản phẩm thay vì suy rộng từ một con số tổng hợp.

Độ phủ ngôn ngữ chưa đồng nghĩa khả năng tiếp cận

Google thừa nhận hơn ba tỷ người vẫn chưa có Internet ổn định. TranslateGemma có thể chạy trên thiết bị để giảm phụ thuộc vào đám mây, song các mô hình AI vẫn đòi hỏi phần cứng đủ năng lực; hàng trăm triệu người tại những khu vực ít nguồn lực còn sử dụng điện thoại phổ thông.

Hãng đang hỗ trợ Viamo thử nghiệm trợ lý giọng nói AVA trên điện thoại phổ thông tại Rwanda. Đây là một cách tiếp cận giới hạn kết nối trong một bối cảnh cụ thể, không phải bằng chứng rằng mọi người nói các ngôn ngữ được tính trong cột mốc đều đã có thiết bị, đường truyền và tính năng phù hợp.

Thông báo chưa có đánh giá mới riêng cho tiếng Việt

Đối với người dùng Việt Nam, công bố xác nhận tiếng nói và dữ liệu cộng đồng ngày càng giữ vai trò lớn trong chiến lược AI đa ngôn ngữ của Google. Tuy nhiên, hãng không công bố kèm bảng đánh giá mới về tiếng Việt ở từng sản phẩm, cũng không cho biết chất lượng dịch văn bản, hội thoại trực tiếp, phiên âm, giọng vùng miền và hoạt động ngoại tuyến đã thay đổi thế nào.

Trạng thái hiện tại vì vậy khá rõ: Google đã xác nhận phạm vi hơn 300 ngôn ngữ trên toàn bộ công nghệ và sản phẩm, nhưng chưa chứng minh mức hỗ trợ đồng đều và chưa đưa ra lịch trình hoàn thành mục tiêu 1.000. Những dữ liệu còn thiếu — danh mục theo sản phẩm, tiêu chuẩn chất lượng và kết quả đánh giá từng ngôn ngữ — mới quyết định khoảng cách thực tế còn bao xa.

Đọc thêm:

Chia sẻ:

Đăng ký bản tin

Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.

0