Мощный ИИ может замедлить работу: почему бизнесу нужен тест процесса

Корпоративное применение ИИ расширяется, но более мощная модель по-прежнему не гарантирует ускорения конкретного процесса. Для бизнеса решающим остаётся результат всей связки: модели, данных, инструментов, правил доступа и человеческого контроля.
Новые исследования сделали картину менее однозначной. В одних условиях ИИ повышает производительность, в других добавляет время на проверку и исправления, а результаты быстро устаревают вместе с моделями и способами работы. Поэтому оценивать следует не общие способности системы, а её поведение на конкретной операции с учётом затрат и риска.
Распространение ИИ ещё не означает автоматизацию процессов
Между использованием технологии сотрудниками и передачей ей законченной операции сохраняется большой разрыв. Согласно экономической главе отчёта Стэнфордского института человекоцентричного ИИ, в 2025 году ИИ применяли хотя бы в одной функции 88% опрошенных организаций, генеративный ИИ — 70%, тогда как доля внедрения агентов почти во всех функциях оставалась однозначной.
Эти показатели относятся к разным ступеням зрелости. Сотрудник, который просит систему подготовить черновик письма, уже использует генеративный ИИ. Агенту, который должен прочитать заявку, обратиться к корпоративной системе, изменить запись и сохранить проверяемый журнал действий, дополнительно нужны права доступа, интеграции, контроль состояния и процедура восстановления после ошибки.
На этом переходе общая способность модели рассуждать и писать убедительный текст перестаёт быть достаточным критерием. Корпоративная операция должна соблюдать формат, бизнес-правила, последовательность действий и границы полномочий. Одна неверная запись или пропущенное исключение может обесценить множество удачных ответов.
Почему высокий результат модели не равен экономии времени
Такое расхождение обнаружилось, в частности, при разработке программного обеспечения. В эксперименте 2025 года 16 опытных участников выполнили 246 задач в знакомых им открытых проектах: с разрешёнными на тот момент передовыми ИИ-инструментами работа заняла в среднем на 19% больше времени. Переносить этот результат на всех разработчиков, модели и виды задач нельзя.
В феврале 2026 года организация METR описала проблемы повторного эксперимента: самоотбор участников, отказы работать без ИИ, изменённая оплата и параллельное использование нескольких агентов не позволили получить надёжную текущую оценку. Предварительные данные допускали ускорение, однако статистический диапазон включал и противоположный эффект.
Первый эксперимент не доказывает бесполезность продвинутых моделей, а неудачная попытка повторения не подтверждает их безусловную эффективность. Оба случая показывают, насколько результат зависит от участников, инструментов, сложности задач и методики измерения. В стоимость рабочего цикла входят постановка запроса, чтение ответа, исправление результата, проверка побочных эффектов и повторные попытки.
«Избыточная креативность» — неточный диагноз
Корпоративные сбои удобно объяснять тем, что модель оказалась «слишком умной», но такое описание скрывает устройство системы. Модель формирует результат в пределах запроса, контекста, настроек и доступных инструментов. Нежелательное исправление вместо регистрации ошибки обычно указывает на неясную цель, отсутствие жёсткой схемы ответа или чрезмерные полномочия.
Рассмотрим условную обработку счёта. Если система должна только обнаружить расхождение, ей не следует предоставлять возможность менять запись в бухгалтерской системе. Извлечение данных, проверку по формальным правилам, предложение корректировки и её утверждение ответственным сотрудником можно разделить на отдельные этапы.
Более мощная модель способна лучше разобрать неоднозначный документ, но не устраняет недостатки процесса. Компактная модель тоже не становится надёжной только благодаря меньшему размеру. При неполных входных данных, неопределённом эталоне или возможности необратимого действия проблема находится не только в выборе модели.
Что именно нужно сравнивать
Общие рейтинги помогают составить первоначальный список кандидатов, но промышленное решение требует проверки в условиях будущей эксплуатации. профиль рисков генеративного ИИ от NIST предостерегает от переноса результатов узких и несистематических оценок, предусматривает испытания в реальных сценариях и документирование случаев, когда человек отменяет решение системы.
Единицей оценки должна быть законченная операция. Для обработки обращения это путь от входящего сообщения до правильно заполненной карточки и подготовленного ответа; для финансовой операции — извлечение полей, сверка, фиксация исключения и передача на утверждение. Качество промежуточного текста имеет смысл только в связи с конечным состоянием системы.
Набор испытаний должен отражать обычные и редкие случаи: нестандартные форматы, пропущенные поля, конфликтующие инструкции и нехватку данных. Для каждого случая заранее определяют допустимый результат, обязательный отказ либо передачу сотруднику. Без таких условий правдоподобное, но необоснованное действие легко принять за успешное выполнение.
Сравнивать следует полные конфигурации в одинаковых условиях. Конфигурация включает версию модели, системные инструкции, подключённый поиск, бизнес-правила, схему ответа, число повторных попыток и уровень человеческой проверки. Изменение любого элемента способно повлиять на итог, поэтому результат всей связки нельзя приписывать одному компоненту.
Какие показатели определяют пользу для бизнеса
Доли правильных ответов недостаточно для оценки корпоративной системы. Существенны доля полностью завершённых операций, частота критических ошибок, число передач человеку, время обработки, стоимость запроса и объём последующей проверки. Отдельного учёта требуют нарушения формата, необоснованные действия и продолжение работы при недостатке данных.
Экономику корректнее считать на успешно завершённую операцию. Недорогой запрос может потребовать нескольких повторов и длительной проверки; более дорогая модель иногда сокращает доработку сложных случаев. Универсального правила в пользу самой компактной или самой способной модели поэтому нет.
Для неоднородного потока может подойти маршрутизация: формальные операции получает более простая конфигурация, неоднозначные случаи — более мощная, а высокорисковые решения остаются за человеком. Однако маршрутизатор входит в ту же систему и тоже нуждается в оценке: его ошибка способна отправить сложный случай в неподходящую ветвь.
Пригодность ИИ определяется результатом операции, а не общим уровнем модели. Если испытание учитывает только убедительность ответа, но исключает время исправлений, обработку исключений и контроль последствий, оно оценивает демонстрацию возможностей, а не корпоративную автоматизацию.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.