Технологии

Anthropic пресекла опасные запросы к Claude — отчёт охватил семь видов вреда

|Автор: Редакция QUASA|4 мин чтения
Anthropic пресекла опасные запросы к Claude — отчёт охватил семь видов вреда

В отчёте Anthropic от 10 сентября 2026 года описана пресечённая активность с использованием Claude за период с декабря 2025-го по август 2026 года. Документ охватывает семь категорий вреда: компания блокировала опасные запросы и связанные аккаунты, усиливала защиту и при необходимости передавала сведения властям и другим участникам отрасли.

За общей формулировкой «пресекла» стоят разные результаты. В одних эпизодах защита Claude отказала пользователям в опасной помощи, в других Anthropic закрыла доступ уже после того, как модель успела написать код или обработать данные. Блокировка аккаунта прекращает работу с Claude, но не обязательно останавливает внешнюю операцию или уничтожает ранее созданный инструмент.

Семь категорий не равны семи успешным атакам

Семь категорий вреда в отчёте Anthropic разделены по типу активности и подтверждённому статусу случаев

Отчёт объединяет случаи с разным уровнем подтверждённого вреда: попытки получить запрещённый ответ, применение модели в действующей операции, разработку программного обеспечения и лабораторные оценки возможностей. Поэтому попадание эпизода в одну из категорий не доказывает ни завершённую атаку, ни создание работоспособного оружия.

  • Кибероперации: разведка целей, поиск уязвимостей, фишинг, написание вредоносного кода, проникновение в системы и обработка похищенных данных.
  • Операции влияния: создание вымышленных персон, сайтов и материалов для скрытого воздействия на аудиторию.
  • Слежка: разработка средств сбора сведений, установления личности и составления досье.
  • Мошенничество: автоматизация обмана, в том числе с помощью поддельных сервисов знакомств.
  • Биологические риски: запросы двойного назначения, способные поддержать опасные исследования патогенов и токсинов.
  • Обычные вооружения: программное обеспечение для ракет, беспилотников, наведения и других военных систем.
  • Незаконная дистилляция: массовое извлечение ответов Claude для переноса возможностей модели в сторонние системы без разрешения.

Основной мерой пресечения внутри платформы была блокировка обнаруженных аккаунтов. Выявленные при расследованиях признаки также добавлялись в системы контроля; связанные учётные записи искали, а технические данные передавали партнёрам, если активность выходила за пределы сервисов компании.

Claude использовали как исполнителя и координатора

Несколько сеансов Claude выполняют разные задачи вредоносной операции, после чего связанные аккаунты блокируются

В наиболее развитых операциях злоумышленники не ограничивались отдельными вопросами. Они распределяли написание кода, исследование целей и проверку результатов между несколькими сеансами Claude, сохраняли состояние работы и повторно собирали инструменты после срабатывания защиты.

В разборе Axios выделены военная разведка, разработка программного обеспечения для ракет в северном Йемене, поиск уйгуров в Сирии и создание системы наблюдения за телефонными сетями Мали. В йеменском эпизоде отдельные экземпляры Claude писали и проверяли код, а после неудачного испытания управляемой ракеты операторы вернулись к модели для анализа причин.

Материалы дела указывают на устойчивую работу над системами наведения и состоявшееся полевое испытание, однако свидетельств появления работоспособного устройства в них нет. При этом у группы уже оставался автономный набор средств моделирования, который мог работать без Claude.

В кибероперациях последствия иногда были конкретнее: отдельные участники проникали в системы и похищали сведения, а модель помогала им поддерживать работу на разных стадиях. Однако цели задавали люди, поэтому описанные случаи не подтверждают полностью самостоятельный выбор жертв моделью.

Биологические запросы не доказывают создание оружия

Опасный биологический запрос заблокирован, но намерение исследователя и создание оружия не подтверждены

В биологических эпизодах рассматривались задачи, которые могли поддержать разработку оружия, но одновременно имели научное или медицинское применение. Страны и учреждения в материалах этих дел не названы, а намерение исследователей причинить вред не установлено.

Один из наиболее подробно описанных случаев касался заявки на финансирование исследований вируса чикунгунья. Проект предполагал изменение свойств, связанных с передачей вируса и уклонением от иммунного ответа. Защитный классификатор Claude заблокировал чувствительные запросы, однако посредническая платформа затем направляла отказы к другой модели с менее строгими ограничениями.

Из этого следует более узкий вывод, чем «Claude создал биологическое оружие». Была выявлена потенциально опасная исследовательская цепочка, связанные аккаунты закрыли, а ограничения для биологических запросов двойного назначения усилили, но доказательств создания или применения готового биологического агента не представлено.

Блокировка доступа не всегда завершала внешнюю операцию

В случаях слежки Claude помогал писать расширения браузера, средства сопоставления телефонных номеров с личностями, интерфейсы наблюдения и инструменты анализа социальных сетей. В одном расследовании платформа была развёрнута локально с другой языковой моделью: блокировка пользователя остановила его работу с Claude, но не само развёртывание.

Сходное ограничение действовало для операций влияния. Anthropic могла наблюдать создание поддельных персон, сайтов и автоматизированных процессов, однако после публикации материалов её видимость уменьшалась. Часть кампаний не успела привлечь заметную аудиторию, но отчёт не позволяет независимо проверить охват каждой из них.

Выборка показывает методы, а не частоту злоупотреблений

Как подчёркивает Associated Press, Anthropic назвала опубликованные случаи наиболее заметными и новыми, а не типичными. По этой подборке нельзя определить долю опасных запросов, сравнить распространённость семи категорий или рассчитать, сколько нарушений системы защиты не обнаружили.

Есть и ограничение независимой проверки: технические выводы основаны преимущественно на внутренних расследованиях Anthropic. Полные журналы запросов, личности большинства участников и методы обнаружения публично не раскрыты, поэтому внешние наблюдатели могут подтвердить публикацию и отдельные изложенные сведения, но не всю доказательную базу компании.

Подтверждённый итог ограничен действиями Anthropic на собственной платформе: компания выявляла опасную активность, блокировала запросы и связанные аккаунты, обновляла защиту и делилась частью данных. Неизвестными остаются число необнаруженных операций, судьба инструментов, уже вынесенных за пределы Claude, и реальная частота каждого вида вреда.

Читайте также:

Поделиться:

Подпишитесь на рассылку

Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.

0