Преподаватели права выбрали ответы ИИ в 75% сравнений: границы теста

Главный результат исследования не изменился: преподаватели договорного права предпочитали короткие ответы ИИ ответам коллег примерно в трёх случаях из четырёх. В июньском обзоре Stanford Report указано, что системы ИИ выиграли 75% слепых попарных сравнений, однако влияние таких подсказок на знания и навыки студентов остаётся открытым вопросом.
При этом распространённая формулировка о «профессорах Стэнфорда» неточна: Стэнфордская школа права руководила работой, но оценки давали преподаватели из разных университетов США. Согласно рукописи от 27 мая 2026 года, в исследовании участвовали 16 преподавателей из 14 юридических школ, которые рассмотрели 40 вопросов и выполнили 2918 анонимизированных сравнений; средняя доля побед двух систем ИИ составила 75,33%.
Что именно выбирали преподаватели
Эксперимент оценивал не способность ИИ вести курс, принимать экзамен или готовить юридические документы. Исследователей интересовали короткие ответы на вопросы по договорному праву, похожие на те, которые студент первого курса может задать после занятия или во время консультации.
Все участвовавшие преподаватели работали с одним учебником. Они составляли вопросы и писали собственные ответы, а исследовательская группа отбирала задания, охватывавшие содержание судебных решений и правовых норм, объяснение доктрины, разбор гипотетических ситуаций и вопросы юридической политики.
Машинные ответы подготовили Gemini 2.5 Pro с обычными настройками и NotebookLM, которому был доступен учебник курса. Объём текстов ограничили так, чтобы ответы моделей и преподавателей оставались сопоставимыми: это снижало вероятность того, что судьи предпочтут вариант лишь из-за его большей подробности.
Во время оценки преподаватель видел два обезличенных текста и выбирал тот, который предпочёл бы показать студенту. Возможности зафиксировать ничью не было, поэтому итоговый процент означает долю побед в принудительном попарном выборе, а не долю правильных ответов и не результат экзамена.
Почему результат нельзя приписать любому ИИ
Средний показатель объединяет две конкретные конфигурации, использованные с заданными подсказками, ограничением длины и материалами определённого курса. Он не позволяет заключить, что любая большая языковая модель так же успешно ответит по уголовному, международному или российскому праву либо справится с вопросом, требующим проверки актуального законодательства.
Различался и доступный системам контекст. NotebookLM получал материал учебника, тогда как Gemini работал без такого специального подключения. Само наличие учебного текста в контексте не обеспечило решающего преимущества, но из этого нельзя делать общий вывод о бесполезности поиска по документам: эксперимент сравнивал готовые конфигурации целиком, а не изолированный эффект одного технического компонента.
Авторы анализировали, можно ли объяснить выбор внешними признаками машинного текста — длиной, ясностью, структурой и уверенностью формулировок. Эти характеристики отражали лишь часть различий. Такой анализ согласуется с тем, что преподаватели оценивали и содержание, но не устанавливает, какое именно свойство ответа стало причиной преимущества.
Что означает оценка потенциального вреда
Помимо предпочтительного ответа, участники отмечали тексты, которые могли ввести студента в заблуждение или помешать обучению. Объединённый показатель для систем ИИ составил 3,53%, а среднее значение для преподавательских ответов — 12,06%; среди отдельных преподавателей результаты заметно различались.
Эта часть работы измеряла профессиональное впечатление судей, а не реально причинённый вред. Студенты не использовали ответы в учебном курсе, не проходили последующее тестирование, а исследователи не измеряли сохранение знаний, развитие аргументации или способность самостоятельно решать новые задачи.
Поэтому низкая частота предупреждений означает только то, что короткие машинные объяснения реже казались участвовавшим преподавателям педагогически проблемными. Она не доказывает отсутствие галлюцинаций в других условиях и не отменяет необходимость проверять нормы, судебные решения и ссылки перед практическим использованием.
Выборка ограничивает масштаб вывода
Участников набирали среди преподавателей, использовавших один и тот же учебник по договорному праву. Согласившаяся группа не была случайной репрезентативной выборкой всего юридического образования: в ней были сильнее представлены школы из традиционной верхней группы рейтингов и немного слабее — женщины.
Эти особенности не опровергают результат внутри проведённого теста, но сужают его переносимость. Исследование выявило предпочтение конкретной группы американских специалистов при оценке кратких англоязычных ответов по одному предмету, а не универсальное превосходство ИИ над преподавателями права.
Расширенный рейтинг оценивал уже не человек
Непосредственные решения преподавателей относились только к Gemini и NotebookLM. Для сопоставления с более поздними системами исследовательская группа использовала отдельную модель-судью Llama 4 Maverick, предварительно сравнив её решения с коллективными предпочтениями людей.
В автоматизированном расширении новые модели также располагались выше преподавательских ответов. Однако этот результат методологически отличается от основной части исследования: места в расширенном рейтинге определяли не профессора, а ИИ-судья, которому могут быть свойственны предпочтение более длинных текстов, чувствительность к позиции ответа и смещение в пользу родственного семейства моделей.
Проверка согласованности с человеческими решениями делает такой рейтинг полезным дополнительным сигналом, но не превращает его в продолжение исходного слепого голосования. Особенно осторожно следует интерпретировать порядок систем с близкими результатами.
Что изменилось в юридическом образовании
Практический контекст уже выходит за рамки одного эксперимента. В апрельском материале Stanford Report за 2026 год описано, как Стэнфордская школа права включает критическую оценку ответов ИИ, работу с инструментами и проверку их результатов в обучение студентов.
Исследование даёт этому процессу узкое, но важное основание: современная модель способна сформировать краткое объяснение по договорному праву, которое профессиональные преподаватели часто считают предпочтительнее ответа коллеги. Оно не показывает, следует ли заменять консультации преподавателей, и не измеряет последствия длительной зависимости от готовых подсказок.
Непроверенным остаётся главное образовательное последствие: улучшается ли понимание права у студентов, которые получают такие ответы. Для этого потребовалось бы отдельное исследование с участием самих учащихся, сравнением результатов обучения и оценкой того, сохраняют ли они способность самостоятельно анализировать новые правовые ситуации.
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.