Ваша сессия с ИИ - это файл с паролями, которые может восстановить другая модель! — 13 августа 2026 г. в 15:39:23.176
Ваша сессия с ИИ - это файл с паролями, которые может восстановить другая модель! Прекрасная статья и результаты личного эксперимента! 10 августа ELLIS Institute Tübingen и Max Planck Institute опубликовали работу о том, как утекают «мысли» ИИ-моделей. В разделе про раскрытие авторы пишут: провайдеры получили отчёт, после чего те же атаки воспроизвести не удалось. проверил 13 августа. Работает. Из логов, которые разработчики выложили сами, исследователи достали 182 доступа - ключи API и пароли - и 367 фрагментов персональных данных. Логи выкладывали вычищенными. Открытый текст был вылизан. Где лежали секреты Модель перед ответом рассуждает про себя. Это рассуждение подробнее видимого ответа: в нём промежуточные выводы, куски внутренней логики, подтянутые из памяти данные. В ответ оно не попадает. Провайдеры прячут его в зашифрованный блок и отдают клиенту, чтобы не хранить состояние у себя. Клиент прикладывает блок к следующему запросу. Вычистить этот блок пользователь не может. Ключа у него нет, содержимое он не видит. Санитизация работает по открытому тексту и проходит мимо. Запускаем эксперимент! Взял зашифрованный блок рассуждения Claude Opus, стёр открытый текст, оставил подпись. Отдал Claude Haiku - дешёвой модели того же провайдера. Haiku восстановила скрытый ход мысли Opus. Строки совпали с оригиналом дословно. Важно! Второй заход на другом аккаунте: подпись, созданная на одном, расшифровалась на другом. Ключ у Anthropic общий, к пользователю не привязан. Это же механизм работает и у ChatGPT и у Gemini. При этом более умные модели отказываются выполнять расшифровку, ссылаяь на безопасность, а слабенькие делают это без всяких пауз. Почему это не про выбор модели Модель работает штатно. Она ничего не нарушила. Шифрование блоков спроектировали ради экономии на серверном хранении: не держать состояние у себя, а гонять через клиента. Инженерное решение об издержках открыло канал утечки, потому что конверт не привязали ни к пользователю, ни к сессии. Что делать Проверьте, куда уходят транскрипты сессий ваших агентов: в git, в тикеты, в приложения к отчётам, подрядчикам. Относитесь к ним как к секретам и вырезайте блоки рассуждений перед передачей наружу. Управление рисками ИИ живёт на уровне системы и процессов. Ни один выбор модели его туда не переносит.

