Quasa
Установите приложение QUASA
Присоединяйся к пионеру Web3 крипто фриланса сейчас!
Открыть
Новости

ИИ-рецензенты слишком часто хвалят статьи — средняя оценка это скрывает

|Автор: Вячеслав Васипенок|4 мин чтения
ИИ-рецензенты слишком часто хвалят статьи — средняя оценка это скрывает

Согласно препринту, размещённому 4 августа 2026 года, группа исследователей Технического университета Мюнхена изучила правила 111 конференций и медицинских журналов, а затем сравнила человеческие и машинные отзывы к работам ICLR 2026 и Nature Communications. В выборке ICLR фразы с выраженной положительной рекомендацией встретились в 47 из 50 рецензий Llama и в 44 из 192 человеческих отзывов.

Прямой ответ на вопрос о качестве ИИ-рецензий неоднозначен: модели способны писать длинные, связные и внешне обстоятельные отзывы, однако беглость не устраняет завышенные рекомендации, общую критику и слабую привязку части замечаний к рукописи. Препринт пока находится на рецензировании, а его выводы относятся к трём проверенным моделям и двум площадкам, а не ко всем системам и научным дисциплинам.

Положительное смещение искажает итоговую рекомендацию

Человеческие рецензенты ICLR выставили работам в выборке средний балл 4,3. Средняя оценка GPT составила 6,8, Llama и Qwen — по 7,9. При этом GPT умеренно воспроизводила относительные различия между человеческими оценками, тогда как баллы Llama и Qwen почти не разделяли принятые и отклонённые статьи.

Смещение было видно и в свободном тексте. Llama часто завершала отзыв формулами о пригодности работы к публикации или её значительном вкладе, хотя запрос не требовал решения о принятии. Поэтому проблема не сводится к доброжелательному тону: благоприятный вердикт становится слабым сигналом, если модель почти одинаково оценивает работы разного качества.

Этот результат нельзя переносить на любую модель или любой способ генерации рецензии. Авторы использовали конкретные версии Llama 4 Scout, Qwen3-VL-235B-Thinking и GPT-5, заданные инструкции и доступный моделям набор материалов. Изменение модели, запроса или рабочего процесса может изменить результат.

Четыре измерения качества расходятся между собой

Сравнение машинной рецензии по общей оценке, согласованности рекомендаций, конкретности и привязке замечаний к доказательствам

Одна сводная оценка не охватывает все свойства научной рецензии. В эксперименте качество раскладывалось на четыре измерения: согласованность выставленных баллов с человеческими оценками, пересечение с существенными замечаниями людей, конкретность критики и совокупное суждение автоматического оценщика о полном отзыве.

Результаты по этим измерениям не совпали. GPT и Qwen получили от автоматического оценщика более высокие итоговые баллы, чем человеческие отзывы, но совпадение с содержательными претензиями людей оставалось ограниченным. Llama могла выглядеть сопоставимо с человеком по общей оценке на материалах ICLR, одновременно редко указывая на конкретные рисунки, таблицы, разделы и уравнения.

Длина также создавала преимущество, которое частично исчезало после нормализации. Машинные отзывы содержали больше замечаний и поэтому охватывали больше человеческих претензий в абсолютном выражении; при одинаковом числе претензий разрыв резко сокращался. Часть критики сводилась к универсальным требованиям добавить эксперименты, анализ чувствительности или сравнение с более свежими работами.

Именно здесь среднее значение скрывает слабость: гладкий и подробный отзыв может получить хороший совокупный балл, хотя не находит те же существенные ограничения, что специалисты, или не связывает замечания с проверяемым фрагментом рукописи. систематический обзор ACL 2026 также выделяет человеческие, эталонные, модельные и аспектные методы оценки — единой универсальной метрики для ИИ-рецензирования пока нет.

Масштаб автоматизации уже достигнут, автономный вердикт — нет

Пилот AAAI-26 создаёт маркированные отзывы для тысяч работ, а оценки и решения остаются у людей

Ограничения особенно важны на фоне перехода от экспериментов к реальным процедурам. пилот AAAI-26 менее чем за сутки подготовил явно маркированные машинные отзывы для 22 977 работ, допущенных к полной проверке. Система отдельно анализировала содержание, изложение, эксперименты, корректность и значимость, затем проводила самопроверку и человеческий контроль.

Окончательное решение машине не передавали. ИИ-отзыв не содержал числового балла или рекомендации принять либо отклонить статью; члены программного комитета получали его как дополнительный материал рядом с человеческими рецензиями. В опросе участники высоко оценили техническую точность и исследовательские предложения системы, но в свободных ответах также отмечали ошибки при чтении формул и таблиц, слабую расстановку приоритетов и избыточную длину.

Результаты двух работ не противоречат друг другу: они относятся к разным системам и критериям. AAAI проверяла специально спроектированный многоступенчатый процесс и восприятие его участниками, а августовский препринт сравнивал отдельные модели с человеческими отзывами по нескольким независимым измерениям. Производить рецензии в масштабе конференции уже возможно, но это не доказывает надёжность самостоятельного машинного решения.

Сильные замечания не отменяют систематических ошибок

ИИ нельзя описать и как заведомо слабого рецензента. В экспертном исследовании 45 учёных специалисты за 469 часов оценили 2 960 отдельных замечаний к 82 статьям семейства Nature. Агент на базе GPT-5.2 опередил лучшего человеческого рецензента по сочетанию корректности, значимости и достаточности доказательств — 60,0% против 48,2%, — но машинные рецензенты значительно чаще повторяли замечания друг друга и демонстрировали 16 устойчивых слабостей.

Сопоставление результатов задаёт более безопасную роль для технологии: ИИ может расширять поиск потенциальных проблем и готовить дополнительную обратную связь, но не должен быть единственным судьёй рукописи. Существенные претензии необходимо проверять по тексту, таблицам и расчётам статьи, а оценку новизны, значимости и итоговую рекомендацию оставлять ответственным рецензентам и редакторам.

По состоянию на 9 августа центральный вывод основан на свежем препринте с выборками ICLR 2026 и Nature Communications. Для оценки обобщаемости потребуются независимые проверки на других дисциплинах, языках, версиях моделей и реальных редакционных процедурах — с измерением не только гладкости текста, но и влияния машинных замечаний на качество решений.

Читайте также:

Поделиться:

Подпишитесь на рассылку

Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.

0