
Modulate capta US$ 25 milhões — entender a voz virou negócio antifraude

Em 28 de setembro de 2026, a Modulate anunciou uma rodada de US$ 25 milhões, liderada pela Future Ventures, com participação de Hyperplane e Lakestar; segundo a empresa, o total captado chegou a US$ 60 milhões. O investimento financiará pesquisa, engenharia e ferramentas para levar seus modelos de análise de áudio a mais aplicações empresariais.
No centro da rodada está a Velma, plataforma que examina o som de uma conversa para identificar sinais de fala sintética, intenção e comportamento. A Modulate oferece essa análise para prevenção de fraudes e supervisão de agentes de voz: em ambos os casos, as palavras transcritas contam apenas parte do que ocorreu durante uma chamada.
O que a Velma encontra no áudio
Uma transcrição registra o que foi dito, mas perde características da maneira como alguém falou. Tom, emoção e ênfase podem mudar a interpretação de uma frase; sinais acústicos também podem ajudar a identificar uma voz gerada artificialmente. A Velma trabalha diretamente sobre o áudio e combina essas pistas com a análise da intenção e do comportamento na conversa.
Esse desenho permite distinguir tarefas que parecem semelhantes no texto. Reconhecer um pedido de alteração cadastral é diferente de avaliar se a voz que faz o pedido apresenta sinais de síntese. Também é diferente de perceber que um cliente compreendeu mal a resposta de um agente de IA. A empresa chama de Ensemble Listening Model a arquitetura que seleciona e reúne modelos especializados conforme o problema analisado.
Parte do processamento pode ocorrer durante a chamada. Um alerta emitido enquanto a conversa continua dá à operação a possibilidade de encaminhar uma interação suspeita para verificação ou de corrigir a resposta de um agente. O alerta continua sendo um sinal para orientar uma decisão: a identificação de uma característica vocal, isoladamente, não estabelece que houve fraude.
Fraude e atendimento sustentam a mesma oferta
A prevenção de fraudes é uma aplicação direta da detecção de fala sintética. A Modulate cita o uso de seus modelos por instituições de saúde para proteger chamadas contra tentativas de imitação de voz. Nesse ambiente, reconhecer uma possível voz artificial pode levar a uma checagem adicional antes que uma solicitação sensível avance.
Para um banco, um uso equivalente seria sinalizar uma ligação que pede acesso a uma conta ou mudança de dados por meio de uma voz possivelmente clonada. Trata-se de um exemplo hipotético, não de um cliente bancário anunciado na rodada. O valor do sinal depende de como ele é combinado com os procedimentos de autenticação e com o contexto da chamada.
A supervisão de agentes de voz atende a outra necessidade: perceber quando a conversa falhou mesmo que o diálogo pareça cordial. Ao TechCrunch, Carter Huffman, cofundador e CEO da Modulate, observou que “people will be polite even to, like, AI agents or bots”. Um cliente pode, portanto, manter a educação e ainda sair insatisfeito porque o agente não entendeu o pedido ou não resolveu o problema.
Os modelos também podem observar se o agente segue regras da operação. Isso aproxima a análise de áudio das equipes que avaliam qualidade e conformidade no atendimento, além das equipes de segurança. Para a empresa que já usa agentes de voz, a proposta comercial da Modulate é acrescentar uma camada de compreensão da chamada sem exigir que ela desenvolva separadamente cada modelo de áudio.
As métricas divulgadas e seus limites
A escala declarada é expressiva, mas reúne medidas diferentes. A reportagem do SiliconANGLE registra que a plataforma combina mais de 100 modelos especializados e, segundo a Modulate, analisa mais de 10 milhões de horas de áudio por mês, já processou mais de 600 milhões de horas no total e alcançou 98,9% de acerto na detecção de voz sintética em dados públicos de benchmark.
Horas processadas indicam volume de uso, não a qualidade de cada alerta produzido. A taxa de acerto divulgada descreve um teste com dados públicos; ela não informa, por si só, como o detector se sai em uma chamada telefônica real. Ruído, compressão do áudio, sotaques e métodos de geração de voz podem mudar as condições encontradas pelo sistema.
Para operações no Brasil e em outros mercados de língua portuguesa, seriam especialmente úteis resultados separados por idioma e por tipo de chamada. Também importa conhecer a frequência de falsos alertas no ambiente em que o modelo será usado: um aviso indevido pode atrasar um atendimento legítimo, enquanto uma tentativa de imitação não sinalizada pode seguir pelo fluxo normal. O anúncio da rodada não apresenta esses resultados locais.
O que o investimento deve ampliar
A Modulate pretende usar o capital para desenvolver modelos, ampliar suas ferramentas para desenvolvedores e criar integrações com parceiros. Novas opções de implantação também fazem parte dos planos. Essas frentes são relevantes porque bancos, centrais de atendimento e outros compradores precisam incorporar a análise às chamadas que já recebem, com regras próprias para agir diante dos sinais gerados.
A empresa também trabalha em modelos voltados a setores específicos. Conforme essas integrações chegarem às operações, o dado decisivo para compradores será o desempenho observado em chamadas reais: detectar tentativas de imitação de voz e falhas de atendimento com uma frequência de alertas que permita agir sem interromper indiscriminadamente conversas legítimas.
Leia também:
Artigos relacionados


Austrália barra música feita só por IA — assistência algorítmica continua permitida

Socure capta US$ 156 milhões e compra uma investigadora de fraudes por IA

Mantic capta US$ 25 mi — vencer humanos virou argumento de venda

Ghost creators ganham escala — a identidade virou parte do risco

X-59 completa 25 voos — o teste decisivo ainda é o som no solo
Assine nossa newsletter
Receba as últimas notícias sobre Web3, IA e cripto diretamente no seu e-mail.