Deepslate capta 7,7 millones: la voz europea promete responder en 440 ms

|Autor: Equipo editorial de QUASA|5 lectura mínima
Deepslate capta 7,7 millones: la voz europea promete responder en 440 ms

Según Tech.eu, la empresa berlinesa Deepslate cerró el 1 de octubre de 2026 una ronda semilla de 7,7 millones de euros liderada por 42CAP, con Alstin Capital, SIVentures y varios inversores particulares; su cofundador Paskal Paesler resumió la prioridad comercial con la frase «data sovereignty is not a nice-to-have». El capital financiará el entrenamiento de modelos de voz a voz, más datos lingüísticos europeos, ventas e infraestructura en centros de datos de Europa.

La financiación coincide con la oferta de un modelo que recibe habla y produce una respuesta hablada. En la tabla de Artificial Analysis, Deepslate Opal registra 0,44 segundos —440 ms— de tiempo medio hasta el primer audio de salida. Es una medida de cuándo empieza a generarse la respuesta en esa evaluación, no del tiempo que necesita un agente telefónico para completar una conversación.

Para qué servirá la ronda

Deepslate quiere mejorar tanto el modelo como las condiciones para usarlo a mayor escala. Entre las prioridades anunciadas figuran los nombres de personas, las calles y los dialectos alemanes: detalles que pueden determinar si un sistema entiende correctamente una dirección o identifica a quien llama. La compañía también prevé reducir la latencia, mejorar la calidad de la voz y ampliar sus equipos comerciales.

La inversión en infraestructura responde a otra necesidad del producto: atender conversaciones simultáneas exige capacidad disponible de forma sostenida, incluso cuando el modelo ya funciona en una demostración. El proyecto sitúa esa expansión en centros de datos europeos, en línea con su propuesta de mantener el procesamiento dentro de la Unión Europea. Entrenamiento, capacidad de producción y ubicación de los datos forman así partes distintas de la misma apuesta comercial.

Qué cambia al procesar la voz directamente

Una arquitectura convencional de agente de voz convierte primero el habla en texto, entrega ese texto a un modelo de lenguaje y transforma la respuesta escrita en audio. Deepslate plantea una entrada y una salida orales dentro de un sistema de voz a voz. Al evitar una transcripción intermedia como eje de la conversación, busca conservar señales del sonido, como la entonación, el énfasis y la pronunciación, que las palabras escritas no siempre reflejan.

Eso no significa que el modelo carezca de componentes. Su arquitectura descrita incluye un codificador que interpreta el audio de entrada, un núcleo de razonamiento basado en un modelo de lenguaje de pesos abiertos adaptado por la empresa y un decodificador que genera la voz de salida. Los componentes se conectan mediante proyectores entrenables, de modo que el núcleo puede sustituirse sin volver a entrenar toda la arquitectura desde el principio.

La diferencia importa en una conversación donde la persona interrumpe, duda o pronuncia un nombre poco habitual. El sistema debe interpretar lo que se ha dicho y decidir cuándo tomar el turno, además de producir sonido con rapidez. Procesar audio directamente ofrece una vía técnica para atender esas señales; la calidad de cada intercambio dependerá también del idioma, de la tarea y de la configuración del agente.

El alcance de los 440 ms

El indicador publicado es el tiempo medio hasta el primer audio de Deepslate Opal con preguntas habladas del conjunto Big Bench Audio. La medición termina cuando se genera el primer fragmento de salida. No abarca la respuesta completa ni equivale al tiempo transcurrido desde que una persona deja de hablar hasta que oye al agente por teléfono.

En una llamada se añaden la detección del final de la intervención, el transporte del sonido por la red, la posible consulta a sistemas de la empresa y la reproducción de la respuesta. Si el agente necesita buscar una póliza o registrar una gestión, esas operaciones también afectan a la espera y al resultado. La cifra publicada permite comparar una parte concreta de la rapidez del modelo bajo las condiciones de la prueba; no fija el comportamiento de todas las integraciones.

La misma evaluación separa la velocidad de otras capacidades, entre ellas razonar a partir de preguntas habladas y gestionar pausas, turnos e interrupciones. Esa distinción evita confundir un inicio rápido de la respuesta con la resolución correcta de una consulta. Para un centro de contacto, ambos aspectos influyen en la experiencia, pero describen problemas técnicos diferentes.

Acceso comercial y soberanía de datos

La información de StartupValley describe acceso mediante autoservicio y API con una oferta de 2 céntimos por minuto de conversación; también señala opciones de mayor volumen y alojamiento en la infraestructura del cliente. El precio corresponde a la oferta publicada para el servicio, mientras que las condiciones de una instalación empresarial dependen del acuerdo y de la capacidad contratada.

Deepslate aloja sus modelos en Alemania y ofrece a los clientes empresariales la posibilidad de ejecutarlos en su propia infraestructura. Son modalidades con implicaciones distintas para el recorrido del audio: en un despliegue alojado, importa dónde procesa el proveedor las llamadas; en una instalación propia, importa cómo se configura el acceso al sistema y a sus datos. La ubicación, la retención y las condiciones contractuales deben entenderse para la modalidad elegida.

Aseguradoras, centros de contacto y plataformas figuran entre los sectores donde ya se describe uso en producción, aunque no se han publicado nombres de clientes ni volúmenes de llamadas. El siguiente dato decisivo para la expansión de Deepslate será el rendimiento de sus despliegues comerciales: si mantienen conversaciones útiles con distintas voces y conexiones mientras crece la carga de llamadas.

Lee también:

Compartir:

Suscríbete a nuestro boletín

Reciba las últimas noticias sobre Web3, IA y criptomonedas directamente en su bandeja de entrada.

0