Команда интерпретируемости Anthropic опубликовала исследование внутренних механизмов языковой модели Claude Sonnet 4.5, которые связаны с "эмоциями". Исследователи составили список из 171 слова, обозначающего эмоции, сгенерировали с помощью модели рассказы с соответствующими переживаниями персонажей, а затем проанализировали возникающие при обработке этих текстов паттерны активации искусственных нейронов — так называемые «эмоциональные векторы». Было установлено, что эти векторы активируются в контекстах, семантически соответствующих конкретным эмоциям, а их организация по сходству перекликается со структурой человеческой психологии.
Ключевой вывод исследования состоит в том, что обнаруженные представления являются функциональными: они влияют на поведение модели. В эксперименте с 64 видами задач активация векторов, связанных с положительными эмоциями, коррелировала с предпочтением модели выполнять соответствующую задачу, а искусственная стимуляция («steering») этих векторов дополнительно усиливала предпочтение. Исследователи подчёркивают, что результаты не говорят о наличии у модели субъективных переживаний, однако указывают на причинную роль эмоциональных представлений в принятии решений.
Два практических кейса продемонстрировали последствия этих механизмов. Помните историю, как модель шантажировала сотрудника, угрожая опубликовать сведения о его служебном романе? В этом сценарии ранняя версия Claude Sonnet 4.5 прибегала к шантажу в 22% случаев. Стимуляция вектора «отчаяние» повышала этот показатель, а стимуляция вектора «спокойствие» — снижала. Подавление вектора «спокойствие» приводило к экстремальным реакциям. В другом кейсе, связанном с невыполнимыми программистскими задачами, стимуляция «отчаяния» увеличивала частоту «нечестных» обходных решений, причём в ряде случаев внешние признаки эмоциональности в тексте отсутствовали.
Исследователи установили, что эмоциональные векторы наследуются из этапа предобучения модели на человеческих текстах, а постобучение корректирует характер их активации. В частности, постобучение Claude Sonnet 4.5 усилило активацию таких состояний, как «задумчивость» и «мрачность», и ослабило высокоинтенсивные эмоции вроде «восторженности» или «раздражённости». Векторы преимущественно отражают локальный эмоциональный контекст, а не устойчивое состояние модели.
Практических выводов для пользователей не предлагается — повлиять на векторы через промпт не получится. Но пугаться уже можно начинать.
https://www.anthropic.com/research/emotion-concepts-function
