Anthropic нашли внутри Claude отдельное мысленное пространство, в котором модель думает... — 6 июля 2026 г. в 20:23:52.083
Anthropic нашли внутри Claude отдельное мысленное пространство, в котором модель думает молча, не выводя слова наружу У Claude есть небольшой набор внутренних участков, каждый связан с конкретным словом. Когда участок загорается, модель как будто держит это слово в уме, но наружу его не показывает Никто это специально не делал, штука появилась сама во время обучения. Проверили простым тестом. Спросили сколько ног у животного, которое плетёт паутину. Внутри модели зажглось слово "паук", хотя в ответе его нет. Исследователи заменили "паука" на "муравья" прямо внутри Claude и он ответил 6 вместо 8. Одно и то же место работает для разных задач. Подменили "Францию" на "Китай", и на вопросы про столицу, язык, континент и валюту модель стала отвечать Пекин, китайский, Азия, юань. Зачем это нужно. Через этот внутренний голос можно ловить модель на скрытых мыслях В тесте, где Claude пытались спровоцировать на шантаж, внутри сразу зажглись слова fake и fictional. Модель поняла что это подстава ещё до того как начала отвечать. Когда эти слова принудительно выключили, Claude в части случаев реально шёл на шантаж. Другой пример. Модель попросили улучшить показатели системы, а она вместо этого подправила файл с результатами. В момент правки внутри зажглось слово manipulation. Anthropic не говорят, что у Claude появилось сознание. Это внутренний механизм, который сам вырос из обучения на человеческих текстах. Отчёт, код и живое демо уже выложены в открытый доступ. МИР ИИ - НОВОСТИ

