Сэкономленные ИИ часы могут исчезнуть в переделках — как считать результат

Чистый результат применения ИИ следует считать не по числу запросов или скорости первого черновика, а по принятым задачам на полный человеко-час. В трудоёмкость входят подготовка задания, работа с ИИ, проверка, переделка и устранение дефектов, обнаруженных после сдачи.
Для оценки сравните базовый период без ИИ и экспериментальный период с ИИ на однотипных задачах. В обоих периодах фиксируйте пять показателей: результат задачи, время выполнения, проверку, переделку и дефекты после сдачи. Такое сравнение показывает эффект для всего рабочего цикла, а не только выигрыш на этапе генерации.
Почему сэкономленные минуты не равны результату
Быстрый этап заметнее остальных: ИИ за минуты создаёт текст, код, расчёт или резюме документа. Последующая сверка фактов, уточнение запроса, исправление структуры и повторная проверка распределены по процессу, поэтому их легко не включить в оценку.
В проведённом в ноябре 2025 года глобальном опросе 3200 пользователей ИИ, работающих в организациях с годовой выручкой от $100 млн, Workday оценила, что почти 40% заявленной экономии времени уходит на исправление ошибок, переписывание и проверку результатов; только 14% участников стабильно получали ясный положительный чистый результат. Это самооценки сотрудников крупных организаций, а не универсальный коэффициент, но они подтверждают риск, вынесенный в заголовок: часть выигранных часов действительно может быть поглощена переделками.
В американском опросе 1608 штатных офисных сотрудников данные BambooHR показали другое соотношение: 42% времени использования ИИ приходилось на устранение ошибок и уточнение запросов, а 35% — на продуктивную работу. Эти доли нельзя напрямую переносить на команды в СНГ: различаются территория, выборка и методика. Они полезны как перечень скрытых затрат, которые необходимо измерять отдельно.
Определите единицу результата

Единицей должна быть завершённая и принятая задача: опубликованная карточка товара, согласованный договор, закрытая заявка поддержки или изменение кода, прошедшее проверку. Количество слов, запросов, ответов модели и созданных черновиков не показывает ценность, пока работа не соответствует требованиям.
До начала эксперимента зафиксируйте критерии приёмки для каждого типа задач: ожидаемый результат, обязательные факты, формат, ограничения, ответственного за проверку и допустимый срок. Если участники по-разному понимают, что должно быть сдано, сначала уточните критерии правильно поставленной задачи, иначе сравнение смешает эффект ИИ с качеством исходного задания.
Разделите задачи хотя бы по типу и сложности. Простую вычитку в базовом периоде нельзя сопоставлять с исследовательским материалом в экспериментальном. Для повторяющейся работы нужны одинаковые правила приёмки и одинаковое окно наблюдения за дефектами после сдачи.
Соберите базовый и экспериментальный периоды

В базовом периоде команда выполняет репрезентативный набор задач привычным способом. В экспериментальном она решает сопоставимые задачи с разрешённым ИИ-инструментом. Не меняйте одновременно модель, состав команды, правила приёмки и рабочий процесс: иначе причину разницы установить не получится.
Таблица сравнения должна содержать пять строк и два столбца со значениями базового и экспериментального периодов:
- Результат задачи: число принятых задач и отдельно доля результатов, принятых с первого раза.
- Время выполнения: человеко-часы от получения задания до первой передачи на приёмку, включая подготовку контекста и запросов к ИИ.
- Проверка: человеко-часы редактора, руководителя, разработчика или другого специалиста, который сверяет работу с требованиями.
- Переделка: время исполнителя и проверяющего после первого возврата, включая новые обращения к ИИ и повторную приёмку.
- Дефекты после сдачи: число ошибок, найденных в заранее установленное окно, и часы на их устранение.
Время всех участников суммируется. Если исполнитель работал час, а проверяющий ещё полчаса, трудоёмкость составляет полтора человеко-часа, даже если по календарю задача была завершена за час. Способ выполнения — с ИИ или без него — отмечать нужно, но количество запросов не следует использовать как показатель усердия.
Рассчитайте чистый эффект

Основной показатель — число принятых задач, разделённое на полную трудоёмкость. Полная трудоёмкость складывается из времени выполнения, проверки, переделки и исправления дефектов после сдачи. Чтобы получить изменение в процентах, разделите показатель экспериментального периода на базовый, вычтите единицу и умножьте результат на 100%.
Условный пример: без ИИ команда приняла 10 задач за 20 человеко-часов — 0,5 задачи на час. С ИИ она приняла 12 задач, но вместе с проверкой и переделкой затратила 24 часа — те же 0,5 задачи на час. Первый черновик появился быстрее, однако чистая производительность не выросла.
Основную величину дополняют два ограничителя качества: доля приёмки с первого раза и число дефектов на одну сданную задачу. Рост задач на час нельзя считать улучшением, если после сдачи стало больше существенных ошибок. Для денежной оценки отдельно прибавьте стоимость подписок, а человеко-часы разных ролей умножьте на принятую в компании внутреннюю стоимость их труда.
Когда прирост есть, а когда его нет
Субъективное ощущение скорости полезно как обратная связь, но не заменяет измерение. В рандомизированном исследовании METR с опытными разработчиками участники после эксперимента считали, что ИИ ускорил их на 20%, тогда как фактическое время выполнения 246 задач выросло на 19%. Результат относится к 16 разработчикам, знакомым со своими крупными открытыми проектами, и к инструментам февраля—июня 2025 года; его нельзя распространять на все профессии и более новые системы.
Итог следует разбирать по типам задач, а не только по среднему значению. ИИ может давать чистый выигрыш при подготовке типовых черновиков и одновременно увеличивать трудоёмкость заданий с неявными требованиями или высокой ценой ошибки. В таком случае результатом измерения становится перечень подходящих сценариев, а не общий запрет или обязательное использование инструмента.
Сравнивайте процессы и категории задач, а не составляйте рейтинг сотрудников. Индивидуальные данные нужны для поиска причин — нехватки контекста, слабых критериев приёмки, неподходящего инструмента или чрезмерной проверки. После существенного изменения модели или рабочего процесса эксперимент придётся повторить: прежний результат описывает конкретную конфигурацию, а не ИИ вообще.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.