Claude ведёт 26% разработки преемника — полностью автономным он не стал

В материале Anthropic от 17 сентября 2026 года указано, что по состоянию на август Claude «ведёт» 26% измеренной исследовательской и инженерной работы над моделями, участвует как минимум на уровне сотрудничества более чем в 90% этой работы и не действует полностью автономно ни в одной измеренной категории.
Это не означает, что Claude самостоятельно создал четверть новой модели или получил контроль над всем циклом разработки. В разборе Associated Press ведущая роль в 26% задач описана как выполнение большей части отдельной работы от начала до конца по запросу верхнего уровня, но под человеческим надзором; около 90% охватывают более широкую категорию совместной работы.
Что именно измеряет Anthropic
Компания построила внутренний индекс автоматизации исследований и разработки моделей. Для него составили перечень видов работ, выполняемых в Anthropic, оценили степень участия Claude в каждой категории и объединили оценки с учётом веса задач.
Шкала различает отсутствие участия ИИ, минимальное участие, помощь, сотрудничество, ведущую роль и полную автономность. На уровне сотрудничества Claude выполняет крупные фрагменты работы под непосредственным руководством сотрудника. «Ведёт» означает, что модель получает задачу верхнего уровня и выполняет большую её часть самостоятельно, пока человек сохраняет надзор.
Поэтому доли ведущей и совместной работы нельзя складывать. Более широкий показатель включает все задачи, где Claude как минимум сотрудничает с человеком, в том числе работы, уже отнесённые к ведущему уровню. Один показатель описывает распространённость участия системы, другой — глубину делегирования.
Знаменатель метрики — не строки кода, не число выпущенных функций и не доля решений о конструкции будущей модели. Это взвешенная корзина категорий внутренних исследований и разработки. Вес определяется через затраченное сотрудниками время как приблизительную оценку значимости работы, поэтому показатель нельзя переводить в утверждение, что Claude написал четверть кодовой базы или принял четверть ключевых решений.
Где в «ведущей» работе остаётся человек
На ведущем уровне сотрудник задаёт цель верхнего уровня, наблюдает за выполнением и решает, можно ли использовать результат. В примере из методики Claude способен исследовать сбой, найти причину, подготовить исправление и проверить его, но не разворачивает изменение в рабочей системе. Выпуск остаётся решением инженера.
Полная автономность потребовала бы иной границы ответственности: система сама обнаруживает проблему, определяет объём работы, выполняет её, проверяет и внедряет результат без обязательного участия человека. Измерения Anthropic не выявили работ, достигших этой ступени.
Человек участвует и в построении самого индекса. Агенты Claude собирали свидетельства о том, как выполняются разные виды работ, после чего отдельная модель назначала уровень автоматизации. Сотрудники, отвечающие за соответствующие направления, также давали оценки, не зная, какие материалы изучала модель и к какому выводу она пришла.
Машинная и человеческая классификации могли расходиться на границе между сотрудничеством и ведущей ролью. Следовательно, индекс показывает направление изменений внутри компании, но не является прямым подсчётом всех действий Claude. Итог зависит от состава корзины, её весов и отнесения пограничных задач к одной из соседних ступеней.
Почему рост показателя ещё не доказывает самосовершенствование
Доля ведущей работы выросла быстро. The Washington Post приводит динамику внутренней оценки: в феврале показатель составлял ноль, а в августе достиг 26%, причём сотрудники сохраняли общее руководство и надзор.
Ведущая роль в части заданий не равна автономному созданию преемника. Метрика показывает, что Claude выполняет больше работы внутри процесса Anthropic, но не доказывает, что модель сама выбирает исследовательскую программу, утверждает архитектуру будущей системы, распределяет вычислительные ресурсы или выпускает результат без людей.
Формулировка о разработке собственного преемника описывает назначение задач, а не самостоятельные намерения Claude. Работа начинается с целей, поставленных сотрудниками, проходит в инфраструктуре компании и завершается человеческим решением. Даже очень широкое участие модели не тождественно передаче ей такой же доли полномочий.
Какие ограничения остаются у метрики
Корзина видов работ зафиксирована, чтобы сравнивать изменения на одной базе. Это делает динамику последовательнее, но индекс прежде всего показывает автоматизацию исходного набора задач. Он не полностью отражает новые направления, которые могут появляться по мере изменения исследований.
Есть и методологическая зависимость от самой Anthropic: Claude участвует и в работе, и в сборе материалов для её оценки. Модель-судья способна воспроизводить ошибки оцениваемых систем, а общей отраслевой процедуры пока нет. Поэтому показатель нельзя напрямую сопоставлять с возможной метрикой другой лаборатории без одинаковых категорий, весов и правил классификации.
На текущий момент подтверждены быстрый рост внутреннего индекса и сохранение человеческого контроля на его ведущем уровне. Anthropic намерена продолжать измерения и допустить внешних проверяющих к внутренним процессам, однако независимого воспроизведения результата пока нет. Следовательно, 26% — это оценка доли работы, которую Claude ведёт под надзором, а не свидетельство появления полностью автономного или самосовершенствующегося ИИ.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.