Anthropic пресекла опасные запросы к Claude — отчёт охватил семь видов вреда

В отчёте Anthropic от 10 сентября 2026 года описана пресечённая активность с использованием Claude за период с декабря 2025-го по август 2026 года. Документ охватывает семь категорий вреда: компания блокировала опасные запросы и связанные аккаунты, усиливала защиту и при необходимости передавала сведения властям и другим участникам отрасли.
За общей формулировкой «пресекла» стоят разные результаты. В одних эпизодах защита Claude отказала пользователям в опасной помощи, в других Anthropic закрыла доступ уже после того, как модель успела написать код или обработать данные. Блокировка аккаунта прекращает работу с Claude, но не обязательно останавливает внешнюю операцию или уничтожает ранее созданный инструмент.
Семь категорий не равны семи успешным атакам

Отчёт объединяет случаи с разным уровнем подтверждённого вреда: попытки получить запрещённый ответ, применение модели в действующей операции, разработку программного обеспечения и лабораторные оценки возможностей. Поэтому попадание эпизода в одну из категорий не доказывает ни завершённую атаку, ни создание работоспособного оружия.
- Кибероперации: разведка целей, поиск уязвимостей, фишинг, написание вредоносного кода, проникновение в системы и обработка похищенных данных.
- Операции влияния: создание вымышленных персон, сайтов и материалов для скрытого воздействия на аудиторию.
- Слежка: разработка средств сбора сведений, установления личности и составления досье.
- Мошенничество: автоматизация обмана, в том числе с помощью поддельных сервисов знакомств.
- Биологические риски: запросы двойного назначения, способные поддержать опасные исследования патогенов и токсинов.
- Обычные вооружения: программное обеспечение для ракет, беспилотников, наведения и других военных систем.
- Незаконная дистилляция: массовое извлечение ответов Claude для переноса возможностей модели в сторонние системы без разрешения.
Основной мерой пресечения внутри платформы была блокировка обнаруженных аккаунтов. Выявленные при расследованиях признаки также добавлялись в системы контроля; связанные учётные записи искали, а технические данные передавали партнёрам, если активность выходила за пределы сервисов компании.
Claude использовали как исполнителя и координатора

В наиболее развитых операциях злоумышленники не ограничивались отдельными вопросами. Они распределяли написание кода, исследование целей и проверку результатов между несколькими сеансами Claude, сохраняли состояние работы и повторно собирали инструменты после срабатывания защиты.
В разборе Axios выделены военная разведка, разработка программного обеспечения для ракет в северном Йемене, поиск уйгуров в Сирии и создание системы наблюдения за телефонными сетями Мали. В йеменском эпизоде отдельные экземпляры Claude писали и проверяли код, а после неудачного испытания управляемой ракеты операторы вернулись к модели для анализа причин.
Материалы дела указывают на устойчивую работу над системами наведения и состоявшееся полевое испытание, однако свидетельств появления работоспособного устройства в них нет. При этом у группы уже оставался автономный набор средств моделирования, который мог работать без Claude.
В кибероперациях последствия иногда были конкретнее: отдельные участники проникали в системы и похищали сведения, а модель помогала им поддерживать работу на разных стадиях. Однако цели задавали люди, поэтому описанные случаи не подтверждают полностью самостоятельный выбор жертв моделью.
Биологические запросы не доказывают создание оружия

В биологических эпизодах рассматривались задачи, которые могли поддержать разработку оружия, но одновременно имели научное или медицинское применение. Страны и учреждения в материалах этих дел не названы, а намерение исследователей причинить вред не установлено.
Один из наиболее подробно описанных случаев касался заявки на финансирование исследований вируса чикунгунья. Проект предполагал изменение свойств, связанных с передачей вируса и уклонением от иммунного ответа. Защитный классификатор Claude заблокировал чувствительные запросы, однако посредническая платформа затем направляла отказы к другой модели с менее строгими ограничениями.
Из этого следует более узкий вывод, чем «Claude создал биологическое оружие». Была выявлена потенциально опасная исследовательская цепочка, связанные аккаунты закрыли, а ограничения для биологических запросов двойного назначения усилили, но доказательств создания или применения готового биологического агента не представлено.
Блокировка доступа не всегда завершала внешнюю операцию
В случаях слежки Claude помогал писать расширения браузера, средства сопоставления телефонных номеров с личностями, интерфейсы наблюдения и инструменты анализа социальных сетей. В одном расследовании платформа была развёрнута локально с другой языковой моделью: блокировка пользователя остановила его работу с Claude, но не само развёртывание.
Сходное ограничение действовало для операций влияния. Anthropic могла наблюдать создание поддельных персон, сайтов и автоматизированных процессов, однако после публикации материалов её видимость уменьшалась. Часть кампаний не успела привлечь заметную аудиторию, но отчёт не позволяет независимо проверить охват каждой из них.
Выборка показывает методы, а не частоту злоупотреблений
Как подчёркивает Associated Press, Anthropic назвала опубликованные случаи наиболее заметными и новыми, а не типичными. По этой подборке нельзя определить долю опасных запросов, сравнить распространённость семи категорий или рассчитать, сколько нарушений системы защиты не обнаружили.
Есть и ограничение независимой проверки: технические выводы основаны преимущественно на внутренних расследованиях Anthropic. Полные журналы запросов, личности большинства участников и методы обнаружения публично не раскрыты, поэтому внешние наблюдатели могут подтвердить публикацию и отдельные изложенные сведения, но не всю доказательную базу компании.
Подтверждённый итог ограничен действиями Anthropic на собственной платформе: компания выявляла опасную активность, блокировала запросы и связанные аккаунты, обновляла защиту и делилась частью данных. Неизвестными остаются число необнаруженных операций, судьба инструментов, уже вынесенных за пределы Claude, и реальная частота каждого вида вреда.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.