Claude já lidera 26% do P&D da Anthropic — autonomia ainda não chegou

Em 17 de setembro de 2026, a Anthropic divulgou um índice interno segundo o qual Claude “liderava” 26% de seu trabalho medido de pesquisa e desenvolvimento de modelos em agosto. A publicação técnica da Anthropic também informa que mais de 90% desse P&D estava no nível de colaboração ou acima, nenhuma parte examinada havia alcançado autonomia plena e avaliadores externos deverão receber acesso comparável ao das equipes internas de risco.
O dado mostra que Claude ajuda a desenvolver as gerações seguintes dos modelos da empresa, não que esteja construindo sozinho o próprio sucessor. A reportagem da Associated Press descreve os mesmos 26% como tarefas realizadas em grande parte de ponta a ponta, a partir de uma orientação de alto nível, mas ainda sob supervisão humana.
O que “liderar” significa na medição
O verbo usado no índice não equivale a independência. A escala vai de AL0, sem participação de IA, a AL5, no qual o sistema opera de forma plenamente autônoma e sem uma pessoa no circuito. Entre esses extremos, o AL3 corresponde à colaboração e o AL4, à liderança.
No AL3, Claude executa blocos grandes de uma tarefa, mas recebe direção humana próxima. No AL4, pode partir de uma solicitação de alto nível, conduzir a maior parte do trabalho de ponta a ponta e resolver dificuldades intermediárias; uma pessoa ainda acompanha o resultado e conserva decisões relevantes.
A metodologia ilustra a diferença com a falha de um fluxo de dados. No AL4, o sistema poderia examinar registros, localizar a causa, escrever e testar uma correção e documentar as mudanças. A implantação continuaria dependendo de um engenheiro, que avaliaria a solução e decidiria se ela deveria entrar em produção. No AL5, o próprio sistema identificaria o problema, definiria o trabalho e faria a implantação sem necessidade de intervenção humana.
De onde saíram os 26%
O resultado vem do protótipo Anthropic R&D Automation Index. Para montar sua base, a empresa extraiu tarefas de amostras semanais do trabalho de equipes ligadas ao ciclo de desenvolvimento de modelos, usando registros internos como conversas no Slack e documentação. Agentes Claude transformaram essas atividades em categorias e pesquisaram como cada tipo de trabalho era executado.
Outro Claude atuou como avaliador e atribuiu um nível de automação a cada categoria. Na agregação, as tarefas foram ponderadas por uma aproximação do tempo humano dedicado a elas. Portanto, os 26% não representam funcionários substituídos, decisões estratégicas tomadas pela IA nem uma parcela da empresa controlada por Claude: representam a fração ponderada do P&D mapeado que o avaliador classificou no AL4.
A metodologia tem duas limitações centrais. Modelos Claude ajudaram a produzir as evidências e também a julgá-las, o que pode reproduzir erros correlacionados nas duas etapas. Além disso, o índice acompanha uma cesta de atividades baseada no trabalho observado em um período específico; ele pode registrar a automação de tarefas conhecidas sem captar integralmente novas tarefas assumidas pelos pesquisadores humanos.
A validação interna encontrou divergências sobretudo nos casos de fronteira. Separar colaboração de liderança exige julgar quanta direção, revisão e intervenção humana uma tarefa recebeu. O percentual deve, por isso, ser lido como resultado de uma metodologia interna, não como medida universal de autonomia.
A supervisão ainda opera em várias camadas
Liderança de tarefa não significa ausência de controle durante a execução. A medição proposta separa cobertura — a parcela das ações examinada por monitores —, latência de revisão e taxa de atividades bloqueadas, redirecionadas ou encaminhadas para análise humana.
A reportagem da Reuters registrou cerca de 30 mil agentes operando simultaneamente na principal plataforma interna de pesquisa e engenharia da Anthropic em agosto; as ações eram examinadas antes da execução, e aproximadamente uma em cada 47 mil decisões foi bloqueada entre mais de um bilhão analisadas no mês.
Esses números descrevem a infraestrutura declarada de monitoramento, mas não demonstram sua eficácia. Cobrir as ações de uma plataforma não prova que o monitor reconhece todos os comportamentos problemáticos, e o retrato não abrange necessariamente outras ferramentas internas. Uma comparação robusta exigiria também taxas de detecção em testes controlados, falsos positivos e identificação dos ambientes fora da observação.
Computação mede outra dimensão do desenvolvimento
A terceira métrica separa a capacidade computacional destinada ao desenvolvimento de modelos daquela classificada como trabalho de segurança. Ela responde a uma pergunta diferente: mostra como um recurso técnico foi distribuído em determinado período, não quanto das decisões de pesquisa ficou sob controle humano.
A comparação exige cautela porque segurança e desenvolvimento de capacidades podem se sobrepor. Pesquisas intensivas em trabalho especializado também podem consumir pouco processamento, enquanto treinamento e inferência demandam muito. Uma fotografia curta da computação, portanto, não estabelece uma tendência nem mede todo o esforço dedicado à segurança.
O que falta para comparar laboratórios
Os percentuais só serão comparáveis entre empresas se os laboratórios adotarem definições operacionais equivalentes. Isso inclui o mesmo significado para colaboração, liderança e autonomia; critérios explícitos para intervenção humana; regras compatíveis de ponderação; identificação do universo de tarefas coberto; e controle das mudanças na cesta de atividades.
Também será necessário separar quem produz a evidência de quem atribui a classificação. Auditorias independentes poderiam repetir avaliações sobre amostras de tarefas e registrar o grau de concordância entre modelos e revisores externos. Na supervisão, seria preciso distinguir cobertura, latência, bloqueios automáticos e encaminhamentos humanos; na computação, categorias e períodos teriam de ser compatíveis.
A prometida abertura dos processos a avaliadores externos ainda precisa resultar em verificações publicadas. Até lá, o índice documenta uma participação relevante de Claude no desenvolvimento dos modelos, mas não comprova autoaperfeiçoamento recursivo: a iniciativa, a aprovação e a responsabilidade final permanecem com pessoas.
Leia também:
Assine nossa newsletter
Receba as últimas notícias sobre Web3, IA e cripto diretamente no seu e-mail.