Исследователи представили работу CoT Forgery, демонстрирующую эффективность методов обх... — 26 июля 2026 г. в 11:20:16.496
Исследователи представили работу CoT Forgery, демонстрирующую эффективность методов обхода ограничений в больших языковых моделях. В экспериментах метод показал в среднем около 60% успешности на тесте jailbreak и около 61% в сценариях агентной эксфильтрации против близких к нулю исходных показателей на протестированных конфигурациях. 📊 Успешность атаки возрастала с количеством попыток. При 10 000 вариаций авторы сообщали о 89% успешности для протестированной тогда версии GPT-4o и 78% для Claude 3.5 Sonnet. В категории LLM01:2025 OWASP отдельно выделяет прямые инъекции от пользователя и косвенные — из сайтов, файлов и других внешних источников. Это подчеркивает системный характер уязвимостей, требующий внимания к безопасности на уровне архитектуры. 🔹 Первый Нейронный