
Anthropic põe avaliadores dentro do laboratório — acesso será de funcionário

Anthropic e Accenture anunciaram uma equipe externa que trabalhará dentro do processo de desenvolvimento dos modelos de fronteira da Anthropic. No comunicado oficial de 18 de setembro de 2026, a empresa definiu o acesso como comparável ao de funcionários e informou que cada parceira espera investir pelo menos US$ 1 bilhão nessa capacidade durante cinco anos.
A equipe será liderada pela Faculty, área especializada em inteligência artificial da Accenture, e atuará ao lado dos times internos e dos parceiros de segurança da Anthropic. A reportagem da Reuters apresenta o compromisso conjunto como pelo menos US$ 2 bilhões e confirma que o trabalho incluirá red teaming, avaliações de alinhamento e testes das salvaguardas dos modelos.
O acesso começa antes de o modelo ficar pronto
A mudança central está no momento e na profundidade da avaliação. Em vez de receber apenas uma versão delimitada para testes pontuais, o grupo integrado poderá observar os modelos durante o treinamento, acompanhar decisões sobre desenvolvimento e implantação e conversar diretamente com funcionários.
Isso amplia o objeto da avaliação. A equipe poderá examinar não apenas as respostas finais de um sistema, mas também o cumprimento dos compromissos de segurança, a reação da empresa a falhas e possíveis pontos cegos no processo interno. O desenho divulgado também prevê que os avaliadores possam relatar incidentes e oferecer ao público uma descrição mais informada dos benefícios e riscos.
O acesso comparável ao de um funcionário não altera o vínculo institucional: os especialistas continuarão ligados à Faculty e à Accenture, não passarão a integrar o quadro da Anthropic. “Acesso de funcionário”, portanto, descreve a profundidade da entrada no laboratório, e não uma contratação pela empresa avaliada.
O acordo não equivale a uma auditoria formal
A parceria combina atividades que costumam ocorrer separadamente. O red teaming tenta induzir falhas ou contornar proteções; as avaliações de alinhamento examinam se o comportamento do modelo permanece compatível com objetivos e limites definidos; e os testes de salvaguardas verificam se as barreiras resistem a usos adversariais.
Essas funções também aparecem em avaliações externas convencionais, mas normalmente são aplicadas a uma versão específica do modelo e dentro de um escopo limitado. O novo arranjo adiciona acompanhamento contínuo e acesso às decisões internas. Isso pode aumentar a capacidade de encontrar problemas, sem transformar automaticamente o avaliador em auditor, regulador ou instância com poder de veto.
Não foram divulgados critérios formais de auditoria, obrigações de correção nem autoridade para interromper um treinamento ou impedir um lançamento. A responsabilidade final pela segurança e pelas decisões sobre os modelos permanece com a Anthropic.
Quem acessa, quem paga e quem decide
A governança anunciada pode ser resumida em quatro frentes:
- Acesso: a equipe liderada pela Faculty trabalhará dentro da Anthropic, ao lado dos times internos e dos parceiros de segurança, com acesso comparável ao de funcionários.
- Atribuições: o grupo avaliará e testará modelos de forma adversarial, conduzirá avaliações de alinhamento e examinará salvaguardas.
- Financiamento: Anthropic e Accenture esperam investir pelo menos US$ 1 bilhão cada durante cinco anos. Trata-se de uma previsão de investimento em capacidade de avaliação, não de um desembolso já realizado nem do preço divulgado de um contrato único.
- Responsabilidade final: a Anthropic continuará responsável pela segurança, pelo treinamento, pelas modificações e pelo lançamento de seus modelos.
O acordo não é exclusivo. A Anthropic pretende acrescentar outros avaliadores, enquanto a Accenture poderá exercer função semelhante para outros desenvolvedores. Essa abertura pode diversificar os participantes, mas ainda não estabelece regras comuns para comparar o trabalho de diferentes equipes.
O financiamento limita a independência verificável
No arranjo inicial, a própria Anthropic financiará diretamente o trabalho realizado pela Accenture. Isso não prova que as avaliações serão direcionadas, mas cria um conflito estrutural: a organização examinada paga a empresa encarregada de fiscalizá-la.
O relato do TechCrunch registra que ainda não existem padrões para o acesso dos avaliadores ou para a comunicação de suas conclusões. Também continuam indefinidas as condições para publicar resultados, registrar discordâncias e revelar eventuais restrições impostas pela empresa avaliada.
No longo prazo, o modelo defendido para financiar avaliações independentes dependeria de fundos compartilhados ou de recursos governamentais. Como esses mecanismos ainda não estão disponíveis, a parceria começará com pagamento direto, enquanto projetos-piloto com organizações sem fins lucrativos poderão testar outros formatos de financiamento.
Há ainda uma diferença entre independência organizacional e poder efetivo. A Accenture é uma empresa separada da Anthropic, mas não foram anunciadas garantias de publicação irrestrita, mandato mínimo, proteção contra encerramento do contrato ou efeito obrigatório para uma conclusão desfavorável.
O investimento está definido; as regras, não
O acordo estabelece quem liderará a equipe, quais tarefas serão executadas, qual será o nível geral de acesso e quanto as duas empresas esperam investir. Ele ainda não informa a composição do grupo, o cronograma operacional, os protocolos públicos de avaliação nem as consequências de uma falha grave identificada antes de um lançamento.
Os primeiros relatórios e as futuras regras de governança mostrarão se o acesso interno produzirá fiscalização com autonomia verificável ou uma modalidade mais profunda de consultoria técnica contratada. Por enquanto, a parceria amplia a capacidade de observação externa, mas não resolve sozinha os problemas de financiamento, divulgação e autoridade que determinam a independência de uma avaliação.
Leia também:
Artigos relacionados


Anthropic põe avaliadores dentro do laboratório — US$ 2 bi em jogo

Alinhamento de IA não é um placar único — saiba o que um benchmark deixa escapar

Google e Accenture montam tropa de 1.000 engenheiros para agentes

SafeMind põe IA contra IA — os ganhos ainda são testes da CrowdStrike

Palo Alto põe várias IAs para caçar falhas — nenhuma passa de 40% sozinha
Assine nossa newsletter
Receba as últimas notícias sobre Web3, IA e cripto diretamente no seu e-mail.