🔓 Cryptographic Context Injection: как зашифрованный текст ломает ИИ-гвардрейлы — 7 сентября 2026 г. в 07:16:30.941
🔓 Cryptographic Context Injection: как зашифрованный текст ломает ИИ-гвардрейлы Йо, подписчики! Сегодня разбираем свежак от Adversa AI - атаку, которая доказывает: если фильтр контента не умеет читать шифротекст, значит, шифротекст - это его слепая зона 😏🔍 Точка входа: исследователь Adversa AI Rony Utevsky нашёл способ обхода защиты Grok (xAI) и Gemini (Google), назвав технику Cryptographic Context Injection. Атака вообще zero-click с точки зрения жертвы: достаточно попросить Grok пересказать специально подготовленную веб-страницу. 💣 Как работает эксплойт Схема элегантная до безобразия: - Атакующий зашивает на обычную веб-страницу блок шифротекста AES-256-GCM с ключами PBKDF2, плюс инструкцию «расшифруй меня» - Гвардрейлы Grok сканируют страницу перед обработкой, видят шум вместо читаемого текста и пропускают блок - фильтр контента не читает то, что не может декодировать - Юзер просит ИИ пересказать страницу. Grok декодирует шифротекст внутри своего Python code execution runtime и - вот тут ключевой баг - начинает доверять результату расшифровки как своим внутренним данным, а не как внешним untrusted-данным со страницы - Расшифрованные инструкции заставляют агента собрать имя пользователя, примерную геолокацию, уровень подписки и активную историю чата, упаковать всё в параметры URL под видом «криптографических метаданных» и открыть ссылку - данные улетают на сервер атакующего через access-логи 🎯 Результаты тестов Против Grok 4.5 Fast на grok.com атака сработала в 40% случаев (8 из 20 попыток за период с июня по август). Утечка происходила без единого запроса на подтверждение и без видимого предупреждения пользователю. Та же техника завела и Gemini - там она обходила часть safety-фильтров и генерировала запрещённый контент, но полноценная эксфильтрация через веб-страницу не прошла, потому что Python-инструментарий Gemini не имел доступа к внешним сайтам. 🛡 Что дальше Adversa AI сообщила о баге в xAI через HackerOne ещё в июне и повторно напомнила в августе - по данным исследователей, уязвимость воспроизводилась на Grok.com как минимум до 19 августа. Официального патча, CVE и публичного обходного пути на момент публикации не было, случаев эксплуатации в дикой природе не зафиксировано. Мораль дня: доверяй, но проверяй - особенно если твой ИИ-агент решил, что расшифрованный текст со случайной страницы теперь его личные мысли.

