ИИ-агенты отработали 3,1 дня на один человеческий — это не рост в 3,1 раза

OpenAI 6 сентября опубликовала предварительные данные о применении программных агентов в своём исследовательском подразделении. К середине августа 2026 года на каждый восьмичасовой день человеческого труда приходилось 3,1 восьмичасового дня работы агентов, то есть в сумме около 24,8 часа машинного исполнения.
Этот показатель описывает объём использования агентов, а не ускорение исследований в 3,1 раза. В публикации OpenAI от 6 сентября измерения названы предварительными: компания фиксирует параллельные сеансы и рост числа экспериментов, но признаёт, что доступные вычислительные ресурсы с 2025 года также значительно увеличились.
Что именно вошло в отношение 3,1 к 1

В числителе находится суммарная продолжительность работы агентов, приведённая к стандартным восьмичасовым дням. Это машинное время может накапливаться параллельно: исследователь запускает несколько основных агентов, а те могут создавать подчинённые процессы. Учитывается совокупное исполнение всех этих задач, а не только время, прошедшее по часам для человека.
Механику показывает условный пример. Если за один человеческий рабочий день четыре независимые агентские задачи выполняются по шесть часов одновременно, они накапливают 24 часа машинного времени. Ещё 48 минут исполнения доведут сумму до 24,8 часа, или 3,1 стандартного дня, хотя для человека по календарю прошёл только один день.
Из такой арифметики нельзя узнать, были ли четыре результата правильными, завершёнными и пригодными для дальнейшей работы. разбор Swarmz от 8 сентября проводит ту же границу: отношение измеряет накопленное машинное время, поэтому не является заявлением о трёхкратном ускорении исследований.
Почему больше запусков ещё не означает больше результатов

Параллельность действительно позволяет быстрее выполнять хорошо разделяемые операции: писать код, настраивать исследовательскую инфраструктуру, следить за запусками и разбирать технические сбои. OpenAI также зафиксировала рекордное с начала наблюдений число экспериментов на активного экспериментатора в августе 2026 года и связала его по времени с более широким применением Codex.
Однако полный исследовательский цикл этим не исчерпывается. Человек по-прежнему выбирает приоритеты, проектирует проверки, оценивает идеи и результаты, а затем решает, какие системы масштабировать, приостановить или выпускать. Если агенты одновременно подготовят три варианта решения, исследователю всё равно придётся последовательно проверить каждый из них и разобраться в расхождениях.
Увеличение потока задач поэтому может перенести узкое место из исполнения в проверку. Даже среди успешных агентских заданий, которые заняли бы у человека от четырёх до восьми часов, более половины за последние шесть месяцев потребовали хотя бы одного вмешательства. Категория «успешно» в этой статистике не обязательно означает полностью автономный путь от постановки задачи до принятого результата.
Есть и ещё одно ограничение причинного вывода. Вместе с использованием агентов заметно вырос доступный вычислительный бюджет, поэтому наблюдаемый максимум экспериментов нельзя целиком приписать автоматизации. Публичные данные показывают совпадающие изменения, но не позволяют отделить вклад агентов от эффекта дополнительной инфраструктуры.
Параллельная работа требует дорогих вычислений

Интенсивность внедрения видна и по оценке потребления: публикация ITPro от 7 сентября подтверждает более $600 в день для медианного исследователя и свыше $7000 для пользователя из 90-го процентиля. Это стоимость обработки запросов по публичным тарифам API, а не раскрытый внутренний счёт OpenAI.
Такая оценка показывает масштаб потреблённых вычислений, но не их экономическую отдачу. Для неё понадобились бы фактическая себестоимость исполнения, затраты человеческого времени на контроль и ценность результатов, которые выдержали проверку. Большой расход токенов может сопровождать продуктивную работу, однако сам по себе этого не доказывает.
По той же причине нельзя сравнивать отношение 3,1 между компаниями без общей методики. На итог повлияют продолжительность сеансов, учёт подчинённых агентов, состав исследовательского подразделения и правила признания задачи успешной. OpenAI отдельно уточняет, что словом «исследователь» охватывает не только непосредственных авторов экспериментов, но и сотрудников, развивающих инфраструктуру или управляющих проектами.
Какие данные показали бы реальное ускорение
Чтобы превратить статистику использования в оценку производительности, нужно измерять выход полного исследовательского цикла. Отношение машинных и человеческих часов полезно как индикатор масштаба внедрения, но рядом с ним необходимы показатели, связанные с проверенным результатом:
- число завершённых экспериментов за сопоставимые периоды и при неизменном определении завершённости;
- доля принятых результатов, которые прошли проверку и повлияли на код, дальнейшее исследование или обучение модели;
- время человеческой проверки, включая исправление ошибок, повторные запуски и разбор конфликтующих выводов;
- полное календарное время от постановки гипотезы до подтверждённого решения;
- затраты на принятый результат, объединяющие вычисления и человеческий труд.
Для убедительного причинного вывода понадобилось бы также сравнение сопоставимых команд или периодов при контролируемом вычислительном бюджете. Иначе рост числа экспериментов может объясняться одновременно более способными агентами, большим числом параллельных запусков и расширением вычислительной инфраструктуры.
На данный момент подтверждён прежде всего новый масштаб внутреннего использования агентов OpenAI: их суммарное время исполнения существенно превысило человеческое рабочее время. Компания представила признаки ускорения отдельных операций, но не опубликовала набор показателей, который позволил бы назвать 3,1 коэффициентом роста общей исследовательской производительности.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.