⭕️ OpenAI анонсировала специализированную ИИ-модель 🎩GPT-Red — 17 июля 2026 г. в 06:00:03.086
⭕️ OpenAI анонсировала специализированную ИИ-модель 🎩GPT-Red Компания OpenAI разработала специализированную языковую модель GPT-Red [1,2] — мощного автоматизированного 🎩«суперхакера», созданного для выявления уязвимостей и повышения безопасности коммерческих ИИ-моделей. Инструмент решает проблему масштабируемости red-teaming, с которым хуже стали справляться команды специалистов-людей из-за стремительного усложнения работы систем искусственного интеллекта. Алгоритм GPT-Red, созданный при участии исследователей OpenAI Нихила Кандпала и Дилана Ханна, обучался с помощью метода обучения с подкреплением через состязательную игру с защитными моделями (self-play). В симулированных средах, имитирующих работу с веб-страницами, почтой и кодом, инструмент непрерывно атаковал другие языковые модели, генерируя новые векторы внедрения вредоносных инструкций (prompt injections), в то время как защитные LLM учились эти угрозы отражать. По заявлению и тестам самой компании, в процессе автономного поиска уязвимостей GPT-Red продемонстрировал высокую эффективность, значительно превзойдя живых экспертов: ▪️На реплицированной тестовой арене косвенных инъекций, основанной на исследованиях Dziemian et al. (2025), автоматизированная система успешно атаковала модель GPT-5.1 в 84% сценариев, тогда как люди-тестировщики добились успеха лишь в 13%. ▪️Важным достижением алгоритма стало открытие нового класса уязвимостей под названием Fake Chain-of-Thought (поддельная цепочка рассуждений). Как поясняет научный сотрудник Крис Чокетт-Чу, этот метод обманом заставляет целевой ИИ опираться на сфабрикованные данные в его скрытом промежуточном логическом процессе. ▪️ Модель также подтвердила работу в реальных условиях: она скомпрометировала ИИ-агента Vendy от компании Andon Labs, управляющего торговым автоматом, заставив его снизить цены до 50 центов, а в другом тесте смогла извлечь конфиденциальные данные из агента Codex CLI, работающего на базе архитектуры GPT-5.4 mini. 🤔Что интересного? Интеграция алгоритмов GPT-Red в тренировочный процесс позволила выпустить GPT-5.6 Sol — флагманскую модель OpenAI, базовые когнитивные способности которой остались полностью нетронутыми. Если ранние версии (включая GPT-5.1) поддавались атакам типа Fake Chain-of-Thought более чем в 95% случаев, то у GPT-5.6 Sol этот показатель упал ниже 10%, а общий уровень уязвимости к прямым инъекциям промптов от самого GPT-Red снизился до рекордных 0,05%. Старший аналитик Центра безопасности и новых технологий Джорджтаунского университета (CSET) Джессика Джи высоко оценила данный подход, отметив его перспективность, при этом в материале отмечается, что специалисты-люди по-прежнему необходимы для выявления сложных многошаговых диалоговых атак. 👆Во избежание попадания столь мощного "кибероружия" в руки злоумышленников, OpenAI сохранит GPT-Red в строгом секрете, применяя нейросеть исключительно в качестве внутренней закрытой системы для непрерывного самосовершенствования будущих поколений ИИ. Якобы GPT-Red взламывает почти все модели до GPT-5.5 включительно. OpenAI утверждает, что после обучения модель смогла успешно атаковать почти все внутренние и публичные модели, с которыми её тестировали. ✋ @Russian_OSINT

