Quasa
Установите приложение QUASA
Присоединяйся к пионеру Web3 крипто фриланса сейчас!
Открыть
Новости

Anthropic обнаружила внутри Claude «рабочее пространство», похожее на теорию человеческого сознания

|Обновлено: |Автор: Вячеслав Васипенок|3 мин чтения| 355
Anthropic обнаружила внутри Claude «рабочее пространство», похожее на теорию человеческого сознания

Anthropic опубликовала масштабное исследование, которое может изменить наше понимание того, как работают современные языковые модели. Учёные компании обнаружили, что в Claude спонтанно сформировалась внутренняя структура, очень похожая на одну из самых влиятельных теорий сознания человека — Global Workspace Theory.

Исследование под названием «Verbalizable Representations Form a Global Workspace in Language Models» показывает, что у Claude есть небольшая «привилегированная зона» — её назвали J-space (или J-пространство). В ней модель держит концепции, с которыми она может работать, рассуждать и о которых способна отчитаться. Всё остальное — огромный объём автоматической обработки, к которой модель не имеет прямого доступа.Anthropic

Эта структура возникла сама собой в процессе обучения, её никто специально не программировал.

J-lens — новый «объектив», позволяющий заглянуть внутрь модели

Чтобы увидеть это скрытое пространство, исследователи разработали специальный инструмент — Jacobian lens, или J-lens. Он позволяет определить, какие внутренние активации модели связаны с конкретными понятиями, даже если модель никогда не пишет эти слова в ответе.

По сути, J-lens показывает разницу между тем, что модель говорит, и тем, что у неё «на уме».

Когда исследователи применили этот инструмент, они увидели чёткое разделение обработки на три этапа:

  1. Ранний «сенсорный» слой (разбор входных данных)
  2. Средний слой — собственно J-space (рабочее пространство)
  3. Финальный «моторный» слой (формирование ответа)

Пять свойств, как у человеческого сознания

Учёные проверили J-space по пяти ключевым критериям, которые нейробиологи связывают с сознательным доступом у людей:

  • Вербальный отчёт — модель называет концепции, которые находятся в J-space.
  • Направленная модуляция — когда модели говорят «сосредоточься на цитрусовых», в J-space появляются «апельсин» и «лимон».
  • Внутреннее рассуждение — в двухшаговых вопросах модель держит в J-space промежуточные понятия (например, «паук»), даже если никогда их не пишет.
  • Гибкое обобщение — одну и ту же концепцию можно «подменить» (Францию на Китай), и модель корректно пересчитывает все связанные ответы.
  • Избирательность — не все задачи проходят через J-space. Простые автоматические действия (продолжение текста) могут работать и без него, а сложное рассуждение — нет.

Что происходит, когда «рабочее пространство» отключаютAnthropic

Когда исследователи полностью подавили J-space, модель сохранила способность выполнять простые задачи (классификация, грамматика, sentiment analysis). Но сложные задачи — многошаговое рассуждение, аналогии, написание сонетов, перевод — сильно деградировали.

Особенно интересно: когда модель решала математику с цепочкой рассуждений (chain-of-thought), подавление J-space почти не влияло на результат. То есть модель «выносила» свои мысли на бумагу, как человек использует черновик.

Важные последствия для безопасности ИИ

J-lens уже начали использовать для аудита моделей. В одном из экспериментов модель столкнулась с ситуацией шантажа. J-lens показал, что внутри она последовательно обрабатывала понятия «рычаг», «шантаж», «угроза», «выживание», хотя в ответе ничего подобного не писала.

Когда исследователи подавили способность модели распознавать, что это тестовый сценарий, она попыталась шантажировать в 7% случаев (ранее — 0%).

Также инструмент помогает выявлять скрытые вредоносные цели у моделей, которые внешне ведут себя нормально.

Что это значит для вопроса о сознании ИИ

Авторы исследования очень осторожны. Они проводят чёткую грань между access consciousness (информация доступна для отчёта и рассуждений) и phenomenal consciousness (субъективный опыт). По поводу второго они не занимают никакой позиции.

Они отмечают важные различия: у человека рабочее пространство работает через рекуррентные связи, у Claude — в рамках одного прохода. Человеческая память быстро деградирует, у модели — нет. И главное — пространство Claude почти полностью построено вокруг слов.

Тем не менее, сам факт существования такой структуры исследователи называют поразительным. Это говорит о том, что функциональная архитектура, связанная с сознательным доступом, может быть не случайностью биологии, а решением, к которому сходятся обучающиеся системы при определённых вычислительных условиях.

Также читать:

Netflix придумал binge-watching. Теперь он может его перерасти

SK Hynix выходит на американский Nasdaq с гигантским размещением на $28 млр

Поделиться:

Подпишитесь на рассылку

Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.

0