Claude já lidera um quarto da própria P&D — a métrica ainda depende dele

A Associated Press registrou que, no anúncio de 17 de setembro de 2026, a Anthropic atribuiu a Claude a liderança de 26% de sua pesquisa e desenvolvimento de modelos em agosto, ante menos de 1% em fevereiro. “Liderar”, nesse índice interno, significa realizar a maior parte de uma tarefa a partir de uma orientação geral, ainda sob supervisão humana — não desenvolver e lançar sozinho um sucessor.
A divulgação de 17 de setembro mostra que Claude já ajuda a construir modelos futuros da Anthropic, mas não comprova uma versão capaz de se aperfeiçoar sem intervenção humana. O Washington Post confirmou que nenhuma parte medida da P&D atingiu autonomia total; além disso, o próprio Claude participou da montagem e da classificação do índice usado para calcular os 26%.
“Liderar” ainda termina em uma decisão humana
A categoria de liderança descreve a execução operacional da tarefa, não a autoridade sobre todo o ciclo de pesquisa. Claude pode receber um objetivo de alto nível, conduzir as etapas intermediárias e preparar um resultado quase completo, mas uma pessoa continua encarregada de supervisionar o processo e decidir se o trabalho será aceito.
Um nível abaixo, a IA “colabora”: executa blocos substanciais, porém exige direção humana mais próxima. Mais de 90% do trabalho medido estava nessa categoria ou acima em agosto. No extremo seguinte estaria a autonomia plena, sem uma pessoa no circuito, patamar que não apareceu em nenhuma parcela avaliada.
Por isso, os 26% não são a fatia de um novo modelo concebida e lançada independentemente por Claude. O índice mistura atividades diversas do ciclo interno — pesquisa, treinamento, produto, ferramentas para desenvolvedores e manutenção de infraestrutura — e estima até que ponto a IA conduz cada tipo de trabalho. Prioridades científicas, aprovação de mudanças e lançamentos continuam fora do significado atribuído à palavra “lidera”.
Como registros internos viraram um índice de automação
Segundo a metodologia e a validação publicadas pela Anthropic, a empresa sorteou semanalmente 20% dos funcionários de cada departamento do ciclo de P&D durante julho, gerou cerca de 15 mil tarefas e as organizou em 542 categorias, das quais 378 eram finais; na checagem, o julgamento do modelo coincidiu exatamente com o humano em 59% dos casos, ante 35% de concordância entre avaliadores humanos, e ficou a no máximo um nível da avaliação humana em 97% deles.
O ponto de partida foram mensagens no Slack e documentos internos das pessoas sorteadas, não uma lista de tarefas preparada previamente pela direção. Um agente Claude examinou esses registros, descreveu as atividades e ajudou a agrupá-las em uma árvore que ia de áreas amplas, como treinamento e produto, a trabalhos específicos de avaliação e infraestrutura.
Outro agente pesquisou como cada categoria era executada, quais ferramentas entravam no processo e quanto cabia à IA. Uma instância separada de Claude atuou como julgadora e escolheu o grau de automação. Nas reconstruções históricas, os agentes só podiam consultar evidências disponíveis até o mês avaliado, uma precaução contra o uso de informações posteriores para reclassificar o passado.
As categorias não receberam peso igual. O índice usa o tempo humano como aproximação da importância de cada atividade: a unidade semanal de cada funcionário foi dividida entre as tarefas em que ele trabalhou. Áreas que concentraram mais tempo de mais pessoas, portanto, exerceram influência maior no resultado agregado.
Claude é também parte do instrumento que mede Claude
A circularidade não se resume ao julgador final. Claude extraiu tarefas dos registros, organizou a taxonomia, reuniu evidências sobre a execução e participou da atribuição dos níveis de automação. O sistema avaliado, assim, pertence à mesma família de modelos empregada em quase toda a cadeia de medição.
A verificação com responsáveis humanos pelas áreas reduz, mas não elimina, esse problema. Eles classificaram o trabalho sem conhecer as evidências e notas produzidas pelos agentes. A proximidade entre as avaliações indica que a escala não foi aplicada de forma aleatória, enquanto a baixa concordância exata entre os próprios humanos mostra que a fronteira entre colaboração e liderança depende de julgamento.
Também não há uma auditoria externa dos dados de origem. Mensagens e documentação interna podem registrar bem algumas atividades e deixar outras parcialmente invisíveis. O tempo dedicado a uma tarefa, por sua vez, mede esforço humano, não necessariamente dificuldade, impacto científico ou importância estratégica.
Há ainda um limite temporal: a cesta de atividades foi congelada para permitir comparações mensais. Se a automação elimina uma tarefa e leva pesquisadores a assumir um trabalho novo, o índice pode registrar o avanço sobre a cesta antiga sem captar integralmente a mudança na composição da P&D. A Anthropic diz que pretende reconstruir e versionar essa base periodicamente.
O salto é relevante, mas ainda não permite comparar laboratórios
A passagem de menos de 1% para 26% em seis meses sustenta a afirmação central: Claude assumiu a condução de uma parcela relevante do processo que produz modelos futuros da Anthropic. O índice é mais informativo do que uma declaração genérica de produtividade porque define graus de participação e pondera uma cesta concreta de trabalho.
Ele não demonstra, porém, que a produção científica aumentou na mesma proporção, que o esforço humano total caiu ou que a empresa está perto de uma melhoria recursiva autônoma. Também não existe uma medição pública equivalente de outros laboratórios feita com a mesma amostra, a mesma ponderação e a mesma fronteira entre assistência e liderança.
O estado confirmado é mais estreito: em agosto, Claude liderava 26% da cesta interna de P&D da Anthropic sob supervisão humana, e o cálculo dependia de registros privados e de avaliações feitas com ajuda do próprio modelo. As próximas divulgações terão de mostrar se a alta persiste, como a cesta acompanha tarefas novas e se avaliadores independentes conseguem reproduzir a classificação.
Leia também:
Assine nossa newsletter
Receba as últimas notícias sobre Web3, IA e cripto diretamente no seu e-mail.