Эмоции в LLM: как модели «чувствуют» скуку и другие состояния
Эмоции в LLM: как модели «чувствуют» скуку и другие состояния Исследователи пытаются понять, могут ли большие языковые модели (LLM) выражать эмоции. Например, при тестировании Claude Mythos на бенчмарках модель не демонстрировала вербально эмоцию скуки, но в её активациях следы скуки всё же обнаружили. Как это работает? Берут сэмплы скучных и увлекательных текстов, усредняют активации и вычитают одно из другого, чтобы найти вектор смещения — разницу в реакциях на разные типы текстов. В статье Do LLMs «Feel»? Emotion Circuits Discovery and Control описаны методы извлечения контекстно-независимых эмоциональных векторов. Для этого анализируют активации после attention и MLP слоёв, вычитая средние активации, чтобы выделить только эмоциональную составляющую. Исследование показало, что можно определить нейроны и attention heads, отвечающие за эмоциональные вычисления. Точность выражения эмоций достигла 99,65% на тестовом наборе данных, что превосходит другие методы. Материалы по ссылкам: 1. Do LLMs "Feel"? Emotion Circuits Discovery and Control В статье рассматривается проблема понимания внутренних механизмов, которые вызывают эмоциональное выражение в больших языковых моделях (LLM), и управления эмоциями в генерируемом тексте. Для исследования были созданы контролируемые данные SEV (Scenario-Event with Valence). В результате выявлены контекстно-независимые механизмы, формирующие эмоциональное выражение. Определены нейроны и attention heads, которые локально реализуют эмоциональные вычисления. Достигнута точность выражения эмоций 99,65% на тестовом наборе данных, что превосходит методы, основанные на prompting и steering. Это первое систематическое исследование, которое раскрывает и подтверждает наличие эмоциональных схем в https://arxiv.org/abs/2510.11328 Источник: оригинальный пост