Claude ведёт 26% исследований Anthropic — до автономной разработки ещё далеко

В опубликованном 17 сентября официальном описании прототипа индекса Anthropic указано: по данным за август 2026 года Claude вёл 26% измеренной работы по исследованию и разработке ИИ, а более 90% работы выполнялось при участии модели не ниже уровня сотрудничества. Полностью автономной работы среди измеренных категорий не зафиксировано.
Это не означает, что Claude самостоятельно создаёт следующую версию себя. Модель уже выполняет значительную часть отдельных исследовательских и инженерных задач, однако люди задают цели, сохраняют надзор и решают, как использовать полученный результат.
Что Anthropic называет ведением задачи
В основе индекса лежит шкала от AL0, где ИИ не участвует в работе, до AL5, где система действует без человека в контуре управления. Уровень AL4, обозначенный как «ИИ ведёт», означает, что модель получает общий запрос и выполняет большую часть задачи от начала до результата, пока человек наблюдает за процессом.
Это определение относится к способу выполнения уже поставленной задачи. Оно не показывает, что Claude самостоятельно выбирает направление исследований, определяет архитектуру будущей модели, распределяет вычислительные ресурсы или утверждает итог разработки.
Ведение задачи не равно управлению всей программой. Даже продолжительная работа модели по общему запросу остаётся частью процесса, цели и границы которого установлены людьми. Именно поэтому формула о самостоятельном создании преемника сильнее, чем позволяют опубликованные данные.
Почему сотрудничество нельзя считать автономией
Категория «ИИ сотрудничает» означает выполнение крупных частей работы под близким руководством специалиста. Более высокая категория «ИИ ведёт» также предполагает человеческий надзор, хотя вмешательство может требоваться реже.
Широкий показатель сотрудничества включает и задачи, в которых Claude занимает ведущую роль. Эти доли нельзя складывать или трактовать как две независимые части работы: одна категория входит в другую, а человеческое участие сохраняется в обеих.
Разбор Associated Press от 18 сентября также отделяет помощь в разработке следующей версии от полностью автономного улучшения: Claude остаётся под наблюдением и пока не замыкает весь цикл создания преемника на себе.
Доля ведущей работы быстро выросла
Рост показателя за несколько месяцев действительно значителен. В феврале доля работы, которую Claude вёл, составляла менее 1%, а к августу достигла указанной в индексе величины; одновременно на основной внутренней платформе компании действовали около 30 тысяч исследовательских и инженерных агентов, следует из публикации Reuters от 17 сентября.
Количество агентов не равно числу заменённых сотрудников. В одной задаче могут участвовать несколько экземпляров модели, распределяющих между собой отдельные операции. Этот показатель характеризует масштаб внутренней системы Anthropic, но не доказывает автономность исследовательской программы.
Индекс также нельзя напрямую сопоставлять с долей программного кода, созданного моделью. Авторство строк кода, выполнение отдельного задания и управление полным циклом разработки измеряют разные стороны работы. Поэтому прежние сведения о коде, написанном Claude, не отвечают на вопрос, способен ли он сам поставить цель и создать новую модель.
Оценка зависит от внутренних данных и самого Claude
Индекс построен на закрытых рабочих записях и внутренней документации Anthropic. Сначала Claude выделял и группировал виды исследовательской работы, затем отдельный экземпляр модели изучал собранные свидетельства и присваивал категориям уровень автоматизации. Вес задач приближённо определялся по затраченному сотрудниками времени.
У такой схемы есть принципиальное ограничение: система участвует и в работе, и в оценке степени собственной самостоятельности. Особенно спорной остаётся граница между тесным сотрудничеством и ведущей ролью — именно от неё зависит центральный показатель статьи.
Человеческая проверка показала, что оценки модели обычно близки к оценкам сотрудников, но полного совпадения нет. Кроме того, исходные рабочие материалы закрыты, поэтому внешние исследователи пока не могут независимо воспроизвести расчёт или проверить распределение всех категорий.
Методика остаётся прототипом одной компании, а общего стандарта для сопоставления лабораторий ещё нет. Внешние оценщики и публикация сравнимых данных другими разработчиками могли бы сделать будущие выпуски индекса убедительнее.
Что уже доказано, а что пока нет
Опубликованные данные подтверждают быстрый рост роли Claude в разработке будущих систем Anthropic. Модель способна выполнять крупные и продолжительные задачи по общему запросу, а её участие охватывает почти всю измеренную исследовательскую работу компании в разных формах.
Доказательств полностью автономного создания преемника при этом нет. Такой вывод потребовал бы работы без человека в контуре: от выбора цели и исследовательского направления до проверки и принятия результата. Пока точнее говорить о расширяющейся автоматизации под человеческим контролем, а не о Claude, который самостоятельно создаёт следующую версию себя.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.