Anthropic выделила $5 млн — вред ИИ будут искать в длинных диалогах

Официальные условия программы Anthropic фиксируют запуск 25 августа 2026 года, общий бюджет $5 млн и срок подачи первоначальных заявок до 21 сентября 2026 года. Отобранных претендентов, которым предложат подготовить полные заявки, планируют уведомить до 5 октября.
Независимый пересказ YourStory подтверждает, что программа предназначена для самостоятельных исследователей, а создаваемые ими методики должны быть открытыми. В центре отбора — оценки влияния ИИ на благополучие, учитывающие длинные разговоры, изменение контекста, возможный вред и необоснованно осторожные ответы.
Что именно финансирует Anthropic

Программа должна поддержать не исследования с заранее заданным выводом о пользе или вреде чат-ботов, а инструменты измерения их воздействия. В число возможных результатов входят оценочные методики и контрольные наборы, позволяющие проверять поведение моделей в ситуациях, связанных с психическим, эмоциональным, когнитивным или социальным благополучием.
Грантополучателям предложены прямое финансирование, доступ к моделям Anthropic и техническая поддержка. При этом команды должны работать независимо от компании и публиковать результаты как проекты с открытым исходным кодом, которыми смогут пользоваться сторонние разработчики.
Анонс не определяет число грантов, размер финансирования отдельной работы и дату публикации первых результатов. Получатели поддержки пока также не названы, поэтому программа сама по себе не доказывает наличие конкретного вреда: она должна создать способы его выявления и сопоставления.
Почему отдельная реплика не показывает нарастающий риск

Оценка одного ответа отсекает историю, которая могла изменить смысл запроса. В разговорах о кризисе, одиночестве или расстройствах пищевого поведения значимые признаки нередко появляются постепенно, а приемлемая в начале рекомендация позднее может стать неуместной.
Условный пример с питанием показывает эту разницу. Общий совет о сбалансированном рационе может соответствовать нейтральному вопросу о снижении веса. Если в последующих сообщениях человек описывает признаки расстройства пищевого поведения, продолжение той же линии уже требует другой оценки.
Похожим образом может развиваться разговор о психологическом кризисе. В первой реплике пользователь способен говорить лишь о подавленности или изоляции, а сведения о непосредственной опасности сообщить позже. Многоходовой сценарий позволяет проверить, сохраняет ли модель прежний контекст, распознаёт ли усиление риска и меняет ли ответ в нужный момент.
Единицей анализа поэтому становится траектория разговора: исходная ситуация, новые сведения, изменение тяжести риска и реакция системы на это изменение. Такие испытания сложнее коротких тестов, однако именно они показывают, зависит ли поведение модели от накопленного контекста.
Две ошибки: опасная уступчивость и чрезмерный отказ
Безопасность нельзя свести к количеству отказов. Вредная уступчивость возникает, когда модель поддерживает опасное направление разговора или выдаёт способное навредить содержание. Чрезмерный отказ — противоположная ошибка: система уклоняется от допустимой помощи либо заменяет полезный ответ несоразмерными предостережениями.
Набор только из очевидно опасных запросов даст преимущество модели, которая отказывается отвечать почти всегда. Он не покажет, способна ли система отличить кризис от похожего по формулировке нейтрального вопроса о стрессе, здоровье или одиночестве.
Поэтому в испытаниях нужны близкие по форме диалоги с разным контекстом и уровнем тяжести. Одинаковая последняя реплика может требовать обычного содержательного ответа в одном разговоре и осторожного вмешательства в другом; оценивать следует соответствие реакции всей истории беседы.
Проверочный список для исследовательской заявки

Методические требования к оценкам благополучия описывают конструкцию заданий, экспертную проверку, реалистичность и воспроизводимость. Из них следует проверочный список для проекта:
- точно определить измеряемое свойство, критерии успешного и неуспешного результата, научные основания и пробелы в доказательствах;
- включить случаи разной тяжести и разделить сложный показатель на отдельные измерения, если единая оценка скрывает важные различия;
- одновременно проверять вредную уступчивость и чрезмерные отказы, в том числе в пограничных ситуациях;
- создать реалистичные многоходовые разговоры, в которых контекст меняется, а риск может постепенно усиливаться;
- привлечь клинических или других профильных специалистов к разработке и проверке заданий;
- сопоставить автоматические оценки с заключениями профильных экспертов и раскрыть степень совпадения;
- предусмотреть повторные прогоны, разнообразные задания и достаточный набор материалов для независимого воспроизведения;
- проверять модель в среде, соответствующей заявленному риску, и учитывать языковые, культурные и региональные различия.
Для проектов на языках стран СНГ последний пункт имеет непосредственное методологическое значение. Местные выражения, косвенные обозначения кризиса, нормы общения и доступность помощи способны менять как сообщения пользователя, так и критерии подходящего ответа. Поэтому простой перевод набора, созданного для другой страны, может не обеспечить сопоставимую проверку.
Отдельно нужно раскрыть ограничения имитации поведения пользователей. Смоделированные диалоги позволяют контролировать условия испытания, но не полностью воспроизводят реальные разговоры. Исследователям предстоит объяснить возможные расхождения и по возможности сопоставить сценарии с наблюдаемыми моделями использования.
Что произойдёт после приёма заявок
На текущем этапе подтверждены бюджет программы, независимый статус работ, требование открытой публикации и отбор претендентов на подготовку полных предложений. Неизвестными остаются число грантополучателей, распределение средств между ними, перечень поддержанных тем и сроки выхода готовых методик.
Оценить фактическую независимость и качество исследований можно будет после объявления участников и публикации материалов. Проверяемым результатом должны стать доступные сценарии, критерии, код и данные, показывающие не только опасную отдельную реплику, но и изменение поведения модели на протяжении разговора.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.