
Modulate capta 25 millones: detectar voces falsas es solo parte del negocio

Modulate anunció el 28 de septiembre de 2026 una financiación de 25 millones de dólares liderada por Future Ventures, con participación de Hyperplane y Lakestar; la empresa sitúa en 60 millones el capital captado en total. Carter Huffman, cofundador y director ejecutivo, resumió la razón de ampliar el producto con una frase: «Voice is becoming a primary interface for AI». El dinero se dirigirá al desarrollo de modelos de audio y a la expansión de herramientas para desarrolladores y alianzas.
La información de TechCrunch describe Velma como una plataforma empresarial que reúne más de cien modelos pequeños para transcripción, análisis emocional, detección de audio sintético y supervisión de agentes de voz; también recoge una cifra de PitchBook de 41 millones de dólares captados antes de esta ronda. Ese historial difiere del total declarado por Modulate y no hay una conciliación pública de ambas cifras. La operación financia una oferta que pretende analizar qué ocurre durante una conversación, además de identificar voces generadas artificialmente.
De moderar videojuegos a analizar llamadas empresariales
La nueva orientación aprovecha una experiencia anterior de Modulate. La compañía comenzó con modulación de voz para videojuegos y después desarrolló herramientas para moderar conversaciones habladas en esos entornos. Allí debía interpretar audio con interrupciones, ruido, expresiones ambiguas y posibles infracciones de las reglas de una comunidad. La supervisión de llamadas y agentes de voz traslada parte de ese trabajo a necesidades empresariales diferentes.
En una llamada de atención al cliente, una transcripción permite saber qué palabras se dijeron. El audio conserva además pausas, énfasis y tono que pueden cambiar el sentido de una respuesta. Para la empresa que opera un agente de voz, también importa si este entendió la solicitud, interrumpió a la persona o siguió las normas aplicables a la conversación. Velma se presenta como una capa de análisis que puede acompañar al sistema de llamadas existente.
Qué hace cada parte de Velma
La detección de habla sintética examina características del sonido para señalar si una voz pudo ser generada por inteligencia artificial. Es una tarea distinta de transcribir una frase o determinar lo que quiso decir quien llamó. Separar esas preguntas permite entender por qué Modulate combina modelos especializados en lugar de ofrecer un único detector de voces falsas.
Otros modelos extraen señales acústicas como emoción, tono e idioma. A partir de esas señales y del contenido de la conversación, la plataforma puede buscar indicios sobre la intención de quien llama, una posible estafa, la insatisfacción de un cliente o el comportamiento de un agente. Su arquitectura Ensemble Listening Model, o ELM, coordina capacidades especializadas para que cada aplicación utilice las señales pertinentes. Una alerta sobre una voz artificial y una alerta sobre el cumplimiento de una política describen, por tanto, problemas diferentes.
La diferencia también afecta a cómo puede incorporarse el producto. Un proveedor de agentes de voz podría necesitar supervisar respuestas y detectar cuándo una interacción requiere intervención humana; un servicio de comunicaciones podría priorizar señales de suplantación o fraude. Son usos de los modelos de análisis dentro de otros productos y operaciones, no una promesa de que Velma sustituya por sí sola la infraestructura de telefonía de cada cliente.
Detectar audio sintético no basta para identificar una estafa
Una voz generada artificialmente puede formar parte de un servicio automatizado legítimo. A la inversa, una persona que habla con su propia voz puede intentar engañar al destinatario. Por eso, detectar síntesis de voz aporta una señal de riesgo, mientras que evaluar un posible fraude exige considerar la conducta y el contexto de la llamada. Esa combinación explica el interés empresarial de una plataforma con varias funciones de escucha.
La comparación publicada por Hyperplane, inversor en Modulate, presenta para una cohorte de agosto de 2026 un error medio equivalente del 1,104 % para el detector de Modulate frente al 2,113 % de Hiya en 14 conjuntos de evaluación. Es una medida de detección de voz sintética bajo esas condiciones, no una tasa de estafas descubiertas en llamadas reales. Tampoco establece el rendimiento de todas las funciones de Velma en conversaciones en español, con el ruido y las reglas particulares de cada organización.
El análisis emocional requiere una distinción parecida. Una respuesta cortés no demuestra que el cliente haya quedado satisfecho, igual que una señal de frustración no explica por sí sola su causa. Relacionar la voz con el desarrollo de la conversación puede ayudar a localizar interacciones que merecen atención; la decisión sobre una infracción o una intervención depende del contexto que la alerta consiga aportar.
En qué se empleará la nueva financiación
Modulate quiere ampliar sus modelos, API, herramientas para desarrolladores e integraciones con socios. Para las empresas que construyen agentes o productos de comunicación, la propuesta consiste en incorporar funciones de análisis de audio sin desarrollar desde cero cada modelo especializado. Ese camino también permite que las capacidades de Velma lleguen a usuarios a través de productos de terceros, además de las aplicaciones propias de la compañía.
La ubicación del procesamiento es otra parte de la expansión prevista. Modulate trabaja en ampliar las opciones para ejecutar su tecnología en instalaciones del cliente y en dispositivos. Son capacidades en desarrollo: el anuncio no fija una fecha de disponibilidad general ni especifica qué configuraciones podrán contratar todas las organizaciones.
Para empresas de países hispanohablantes, la consecuencia concreta dependerá de las integraciones disponibles, de dónde pueda procesarse el audio y del rendimiento de cada función en las variantes de español y condiciones de llamada que utilicen. Los próximos lanzamientos de opciones de despliegue y los resultados medidos en esos entornos mostrarán hasta dónde llega la plataforma fuera de las pruebas y aplicaciones descritas hasta ahora.
Lee también:
Artículos relacionados


Crusoe capta 3.900 millones: los contratos superan cuatro veces su valoración

Un deepfake usa tu cara: detectarlo exige entregar identificación a Google

La Ley de IA ya obliga a identificar chatbots y deepfakes en Europa

Grok Voice Transcribe 2.0 promete el doble de precisión, pero no es el modelo por defecto

El doblaje automático llega a 27 idiomas, pero conviene revisar la voz
Suscríbete a nuestro boletín
Reciba las últimas noticias sobre Web3, IA y criptomonedas directamente en su bandeja de entrada.