ИИ-рецензенты слишком часто хвалят статьи — средняя оценка это скрывает

Согласно препринту, размещённому 4 августа 2026 года, группа исследователей Технического университета Мюнхена изучила правила 111 конференций и медицинских журналов, а затем сравнила человеческие и машинные отзывы к работам ICLR 2026 и Nature Communications. В выборке ICLR фразы с выраженной положительной рекомендацией встретились в 47 из 50 рецензий Llama и в 44 из 192 человеческих отзывов.
Прямой ответ на вопрос о качестве ИИ-рецензий неоднозначен: модели способны писать длинные, связные и внешне обстоятельные отзывы, однако беглость не устраняет завышенные рекомендации, общую критику и слабую привязку части замечаний к рукописи. Препринт пока находится на рецензировании, а его выводы относятся к трём проверенным моделям и двум площадкам, а не ко всем системам и научным дисциплинам.
Положительное смещение искажает итоговую рекомендацию
Человеческие рецензенты ICLR выставили работам в выборке средний балл 4,3. Средняя оценка GPT составила 6,8, Llama и Qwen — по 7,9. При этом GPT умеренно воспроизводила относительные различия между человеческими оценками, тогда как баллы Llama и Qwen почти не разделяли принятые и отклонённые статьи.
Смещение было видно и в свободном тексте. Llama часто завершала отзыв формулами о пригодности работы к публикации или её значительном вкладе, хотя запрос не требовал решения о принятии. Поэтому проблема не сводится к доброжелательному тону: благоприятный вердикт становится слабым сигналом, если модель почти одинаково оценивает работы разного качества.
Этот результат нельзя переносить на любую модель или любой способ генерации рецензии. Авторы использовали конкретные версии Llama 4 Scout, Qwen3-VL-235B-Thinking и GPT-5, заданные инструкции и доступный моделям набор материалов. Изменение модели, запроса или рабочего процесса может изменить результат.
Четыре измерения качества расходятся между собой

Одна сводная оценка не охватывает все свойства научной рецензии. В эксперименте качество раскладывалось на четыре измерения: согласованность выставленных баллов с человеческими оценками, пересечение с существенными замечаниями людей, конкретность критики и совокупное суждение автоматического оценщика о полном отзыве.
Результаты по этим измерениям не совпали. GPT и Qwen получили от автоматического оценщика более высокие итоговые баллы, чем человеческие отзывы, но совпадение с содержательными претензиями людей оставалось ограниченным. Llama могла выглядеть сопоставимо с человеком по общей оценке на материалах ICLR, одновременно редко указывая на конкретные рисунки, таблицы, разделы и уравнения.
Длина также создавала преимущество, которое частично исчезало после нормализации. Машинные отзывы содержали больше замечаний и поэтому охватывали больше человеческих претензий в абсолютном выражении; при одинаковом числе претензий разрыв резко сокращался. Часть критики сводилась к универсальным требованиям добавить эксперименты, анализ чувствительности или сравнение с более свежими работами.
Именно здесь среднее значение скрывает слабость: гладкий и подробный отзыв может получить хороший совокупный балл, хотя не находит те же существенные ограничения, что специалисты, или не связывает замечания с проверяемым фрагментом рукописи. систематический обзор ACL 2026 также выделяет человеческие, эталонные, модельные и аспектные методы оценки — единой универсальной метрики для ИИ-рецензирования пока нет.
Масштаб автоматизации уже достигнут, автономный вердикт — нет

Ограничения особенно важны на фоне перехода от экспериментов к реальным процедурам. пилот AAAI-26 менее чем за сутки подготовил явно маркированные машинные отзывы для 22 977 работ, допущенных к полной проверке. Система отдельно анализировала содержание, изложение, эксперименты, корректность и значимость, затем проводила самопроверку и человеческий контроль.
Окончательное решение машине не передавали. ИИ-отзыв не содержал числового балла или рекомендации принять либо отклонить статью; члены программного комитета получали его как дополнительный материал рядом с человеческими рецензиями. В опросе участники высоко оценили техническую точность и исследовательские предложения системы, но в свободных ответах также отмечали ошибки при чтении формул и таблиц, слабую расстановку приоритетов и избыточную длину.
Результаты двух работ не противоречат друг другу: они относятся к разным системам и критериям. AAAI проверяла специально спроектированный многоступенчатый процесс и восприятие его участниками, а августовский препринт сравнивал отдельные модели с человеческими отзывами по нескольким независимым измерениям. Производить рецензии в масштабе конференции уже возможно, но это не доказывает надёжность самостоятельного машинного решения.
Сильные замечания не отменяют систематических ошибок
ИИ нельзя описать и как заведомо слабого рецензента. В экспертном исследовании 45 учёных специалисты за 469 часов оценили 2 960 отдельных замечаний к 82 статьям семейства Nature. Агент на базе GPT-5.2 опередил лучшего человеческого рецензента по сочетанию корректности, значимости и достаточности доказательств — 60,0% против 48,2%, — но машинные рецензенты значительно чаще повторяли замечания друг друга и демонстрировали 16 устойчивых слабостей.
Сопоставление результатов задаёт более безопасную роль для технологии: ИИ может расширять поиск потенциальных проблем и готовить дополнительную обратную связь, но не должен быть единственным судьёй рукописи. Существенные претензии необходимо проверять по тексту, таблицам и расчётам статьи, а оценку новизны, значимости и итоговую рекомендацию оставлять ответственным рецензентам и редакторам.
По состоянию на 9 августа центральный вывод основан на свежем препринте с выборками ICLR 2026 и Nature Communications. Для оценки обобщаемости потребуются независимые проверки на других дисциплинах, языках, версиях моделей и реальных редакционных процедурах — с измерением не только гладкости текста, но и влияния машинных замечаний на качество решений.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.