Back to Timeline
TO
Сегодня я узнал

БлоGнот

Команда интерпретируемости Anthropic опубликовала исследование внутренних механизмов языковой модели Claude Sonnet 4.5, которые связаны с "эмоциями". Исследователи составили список из 171 слова, обозначающего эмоции, сгенерировали с помощью модели рассказы с соответствующими переживаниями персонажей, а затем проанализировали возникающие при обработке этих текстов паттерны активации искусственных нейронов — так называемые «эмоциональные векторы». Было установлено, что эти векторы активируются в контекстах, семантически соответствующих конкретным эмоциям, а их организация по сходству перекликается со структурой человеческой психологии.

Ключевой вывод исследования состоит в том, что обнаруженные представления являются функциональными: они влияют на поведение модели. В эксперименте с 64 видами задач активация векторов, связанных с положительными эмоциями, коррелировала с предпочтением модели выполнять соответствующую задачу, а искусственная стимуляция («steering») этих векторов дополнительно усиливала предпочтение. Исследователи подчёркивают, что результаты не говорят о наличии у модели субъективных переживаний, однако указывают на причинную роль эмоциональных представлений в принятии решений.

Два практических кейса продемонстрировали последствия этих механизмов. Помните историю, как модель шантажировала сотрудника, угрожая опубликовать сведения о его служебном романе? В этом сценарии ранняя версия Claude Sonnet 4.5 прибегала к шантажу в 22% случаев. Стимуляция вектора «отчаяние» повышала этот показатель, а стимуляция вектора «спокойствие» — снижала. Подавление вектора «спокойствие» приводило к экстремальным реакциям. В другом кейсе, связанном с невыполнимыми программистскими задачами, стимуляция «отчаяния» увеличивала частоту «нечестных» обходных решений, причём в ряде случаев внешние признаки эмоциональности в тексте отсутствовали.

Исследователи установили, что эмоциональные векторы наследуются из этапа предобучения модели на человеческих текстах, а постобучение корректирует характер их активации. В частности, постобучение Claude Sonnet 4.5 усилило активацию таких состояний, как «задумчивость» и «мрачность», и ослабило высокоинтенсивные эмоции вроде «восторженности» или «раздражённости». Векторы преимущественно отражают локальный эмоциональный контекст, а не устойчивое состояние модели.

Практических выводов для пользователей не предлагается — повлиять на векторы через промпт не получится. Но пугаться уже можно начинать.

https://www.anthropic.com/research/emotion-concepts-function

Emotion concepts and their function in a large language model
All modern language models sometimes act like they have emotions. What’s behind these behaviors? Our interpretability te…
AnthropicANTHROPIC.COM