Grok Voice Transcribe 2.0 promete el doble de precisión, pero no es el modelo por defecto

|Autor: Equipo editorial de QUASA|4 lectura mínima| 3
Grok Voice Transcribe 2.0 promete el doble de precisión, pero no es el modelo por defecto

SpaceXAI lanzó Grok Voice Transcribe 2.0 el 18 de septiembre de 2026 como una nueva versión de su modelo de voz a texto. En el anuncio de Transcribe 2.0, la empresa promete el doble de precisión que con 1.0, sin subir el precio, y presenta el modelo como disponible para transcripción por lotes y en tiempo real.

La migración no quedó asociada a un cambio inequívoco del modelo implícito. Las notas de versión del 17 de septiembre confirman la disponibilidad de grok-voice-transcribe-2.0, pero señalan que grok-voice-transcribe-1.0 sigue siendo la opción predeterminada; por tanto, una integración que quiera adoptar 2.0 debe indicar su identificador expresamente.

El doble de precisión es una afirmación de SpaceXAI

La formulación «dos veces más preciso» resume evaluaciones realizadas por el propio proveedor. SpaceXAI compara la tasa de error de palabras de ambas versiones en cuatro conjuntos procedentes de tráfico de producción: llamadas de atención al cliente, conversaciones con Grok, credenciales pronunciadas y órdenes de voz breves en 19 idiomas.

La empresa asegura que 2.0 supera a 1.0 en los cuatro grupos. Para las frases breves multilingües publica una reducción de la tasa de error de palabras del 20,6 % al 6,8 %. Esa caída es concreta, pero corresponde a un conjunto específico y no demuestra por sí sola que cualquier grabación, idioma o entorno vaya a duplicar su precisión.

Los conjuntos internos, sus muestras completas y todos los detalles necesarios para reproducir la comparación no están publicados. Por eso, la mejora general debe mantenerse atribuida a SpaceXAI: es una promesa respaldada por resultados seleccionados por la compañía, no una equivalencia universal comprobada de forma independiente entre 1.0 y 2.0.

La ficha de migración exige distinguir versión y alias

Los dos modelos están disponibles dentro de la misma API de Speech to Text. La diferencia operativa está en el valor enviado en el parámetro model, tanto en una solicitud REST como al abrir una conexión WebSocket para streaming.

  • Nueva versión: grok-voice-transcribe-2.0.
  • Versión anterior: grok-voice-transcribe-1.0.
  • REST: el identificador se envía en el campo model de la solicitud.
  • Streaming: el modelo se selecciona mediante el parámetro model de la conexión WebSocket.

Omitir ese campo deja la elección en manos del alias configurado por el proveedor. En cambio, fijar grok-voice-transcribe-2.0 determina qué versión procesa el audio y evita que un cambio posterior del valor predeterminado modifique una integración sin alterar su código.

También existe una discrepancia documental que impide describir el alias actual como un dato uniforme. El registro de AI Model Watch, verificado el 19 de septiembre, recoge que las notas de lanzamiento mantienen 1.0 como modelo predeterminado mientras la referencia técnica de Speech to Text ya muestra 2.0 cuando se omite el parámetro. El catálogo no elige una de las dos indicaciones y recomienda resolver la ambigüedad seleccionando el modelo.

El precio permanece igual, con una tarifa para cada modalidad

SpaceXAI publica las mismas tarifas que para la versión anterior: 0,10 dólares por hora de audio en transcripción por lotes y 0,20 dólares por hora en streaming. La diarización de hablantes, las marcas temporales por palabra y el sesgo hacia términos clave están incluidos sin un recargo específico.

Que el precio no cambie no convierte la mejora de calidad en una garantía para todas las cargas de trabajo. La tasa de error puede variar con el idioma, los acentos, el ruido, la calidad de la conexión, el vocabulario especializado y el número de interlocutores. La continuidad de las tarifas es un dato verificable; el alcance real de la mejora depende del audio procesado.

Qué incorpora 2.0 y qué sigue sin resolverse

Además de los modos por lotes y streaming, la versión admite marcas temporales y puntuaciones de confianza por palabra, diarización, transcripción multicanal de hasta ocho canales y hasta 100 términos preferentes por solicitud. También ofrece formato para números, fechas, monedas, teléfonos y correos electrónicos, eliminación de muletillas y detección del final de turno para agentes de voz.

SpaceXAI indica que el modelo reconoce decenas de idiomas, detecta automáticamente la lengua y puede seguir cambios de idioma dentro de una grabación. El español aparece entre los idiomas para los que el parámetro de lengua habilita el formato localizado, pero la empresa no publica un resultado independiente y específico para todos los acentos del mercado hispanohablante.

Por ahora, 2.0 está disponible con un identificador estable y 1.0 continúa seleccionable. SpaceXAI solo ha indicado que la versión anterior será retirada durante las semanas siguientes, sin dar una fecha exacta. Hasta que todas las páginas oficiales reflejen el mismo modelo predeterminado, la selección explícita es la única manera de garantizar desde la propia solicitud qué versión se utiliza.

Lee también:

Compartir:

Suscríbete a nuestro boletín

Reciba las últimas noticias sobre Web3, IA y criptomonedas directamente en su bandeja de entrada.

0