Startups e negócios

Koa promete três vezes menos erros — ainda perde para modelos de fronteira

|Autor: Equipe editorial da QUASA|5 min de leitura
Koa promete três vezes menos erros — ainda perde para modelos de fronteira

A Salesforce e a NVIDIA anunciaram o Koa em 15 de setembro de 2026, durante a Dreamforce, em San Francisco. A cobertura da CIO confirma que o modelo de raciocínio para CRM foi construído sobre o NVIDIA Nemotron para uso no Agentforce e que, por enquanto, está restrito a pilotos, com disponibilidade geral prevista para o inverno de 2026 nas regiões dos Estados Unidos.

O principal resultado anunciado é específico, não geral: a Salesforce atribui ao Koa três vezes menos erros em ações avaliadas por seu próprio benchmark de CRM. O trabalho técnico mostra que a especialização melhora o modelo-base e supera o GPT-4.1 nos três testes apresentados, mas não coloca o Koa à frente dos modelos de fronteira mais fortes.

A promessa de menos erros tem limites claros

No anúncio oficial do Koa, a Salesforce afirma que o modelo iguala ou supera sistemas líderes em ações de CRM com três vezes menos erros no CRM Bench. A avaliação inclui tarefas como atualizar uma oportunidade, encaminhar um caso e agendar um acompanhamento.

A formulação não significa que o Koa cometerá um terço dos erros de qualquer concorrente em toda implantação. O comunicado não associa a comparação a um único modelo, não informa a taxa absoluta de erros e não demonstra o mesmo resultado em ambientes de produção de diferentes clientes. O número deve ser lido como uma alegação da Salesforce sobre a configuração avaliada em seu benchmark.

A empresa também afirma controlar os pesos e executar o pós-treinamento e a inferência dentro de sua própria fronteira de confiança. Segundo o mesmo comunicado, nenhum dado de cliente foi usado no treinamento, e essas informações não atravessam a fronteira durante a inferência. Isso descreve a arquitetura oferecida pela Salesforce, mas não substitui a análise das integrações, permissões e políticas adotadas em cada implantação.

O Koa especializa uma base aberta para usar ferramentas

O Koa parte do Nemotron-3-Super-120B, modelo de pesos abertos da NVIDIA. Seu pós-treinamento empregou dados públicos e interações geradas sinteticamente, com cenários voltados à execução de fluxos empresariais: interpretar uma solicitação, escolher uma ferramenta, preencher argumentos, observar o resultado e decidir a ação seguinte.

As especificações desses fluxos são escritas em Agent Script, linguagem declarativa usada para configurar agentes do Agentforce. A pesquisa descreve uma cadeia que transforma as especificações em tarefas de vários turnos, condicionadas por personas e executadas em ambientes simulados. A recompensa depende da conclusão da tarefa e do uso correto das ferramentas, e não apenas da qualidade aparente do texto produzido.

Há uma diferença importante entre a comunicação comercial e a implementação descrita no artigo. Embora o comunicado cite ajuste supervisionado e aprendizado por reforço como técnicas estudadas, a versão final do Koa avaliada no trabalho foi construída aplicando diretamente à base aprendizado por reforço com Group Relative Policy Optimization, ou GRPO. O ajuste supervisionado aparece como uma comparação experimental separada, não como uma etapa combinada do modelo final.

Os benchmarks confirmam o ganho e expõem o teto

A tabela comparativa do artigo técnico, submetido em 14 de setembro, mostra o Koa com 69,41 no Tau2Bench, ante 68,64 da base Nemotron e 54,48 do GPT-4.1; o GPT-5.5 alcançou 83,99. No BFCL, o Koa marcou 66,63%, acima dos 64,73% da base e dos 53,96% do GPT-4.1, mas abaixo dos 67,63% do GPT-5.5 e dos 78,18% do Claude Opus 4.8. No CRM Bench, a média foi 0,86, contra 0,84 da base e 0,81 do GPT-4.1, enquanto o Claude Opus 4.8 obteve 0,87 e o GPT-5.5, 0,90.

Os resultados sustentam duas conclusões simultâneas. A especialização melhorou a base aberta nos três benchmarks e produziu seu ganho mais claro no uso de ferramentas em vários turnos. Ainda assim, o GPT-5.5 liderou o Tau2Bench e o CRM Bench, enquanto o Claude Opus 4.8 ficou bem à frente no BFCL.

A alegação de três vezes menos erros e essas pontuações não medem exatamente a mesma coisa. A primeira resume erros em ações do CRM Bench segundo a Salesforce; a tabela técnica reúne médias de tarefas de atendimento, chamadas de ferramentas e CRM, com métricas e modelos de comparação diferentes. Por isso, o desempenho inferior aos líderes não invalida o ganho especializado, mas impede transformar esse ganho em liderança geral.

Onde a especialização pode fazer diferença

O encaixe mais direto do Koa é o Agentforce, em fluxos de CRM com ferramentas, estados e regras previamente definidos. Nesse contexto, o pós-treinamento pode favorecer a seleção da função correta e a execução de uma sequência operacional específica, enquanto o controle dos pesos e da inferência atende organizações que preferem uma opção hospedada pela própria Salesforce.

Os testes publicados não demonstram, porém, que toda empresa terá três vezes menos falhas. O resultado real dependerá de esquemas de dados, integrações, permissões, instruções e ações personalizadas. Também não é possível generalizar a comparação entre ajuste supervisionado e aprendizado por reforço: o próprio estudo ressalva que a base Nemotron já havia recebido pós-treinamento por reforço.

O estado atual da história é, portanto, de anúncio e pilotos selecionados, não de disponibilidade geral nem de validação independente em produção. O Koa mostrou que uma base aberta pode ganhar precisão em tarefas empresariais após especialização, mas ainda faltam dados sobre custo, latência, confiabilidade em escala e desempenho nos ambientes dos primeiros clientes. Até que esses resultados apareçam, sua vantagem comprovada permanece restrita aos testes publicados, abaixo do teto alcançado pelos modelos de fronteira avaliados.

Leia também:

Compartilhar:

Assine nossa newsletter

Receba as últimas notícias sobre Web3, IA e cripto diretamente no seu e-mail.

0