Claude 5 не взламывается? Один новый attack chain показывает, почему с AI-агентами всё ...
Claude 5 не взламывается? Один новый attack chain показывает, почему с AI-агентами всё сложнее Anthropic показала 0 успешных prompt injection из 720 тестовых запусков и заявила, что Opus 5 стало крайне сложно пробить. А потом Йоханн Рехбергер собрал новую цепочку атак для Claude Code Auto Mode и в своих экспериментах получил 60–80% успешных запусков для отдельных вариантов. ⏺В статье разбирают, почему 0/720 не означает, что пространство атак стало нулевым, как работают PI probe и классификатор Auto Mode, и где именно ломается такая модель защиты. Главное здесь не сама prompt injection, а агент, у которого есть доступ к файлам, командам и сети: новая цепочка может обойти проверки, которых просто не было в исходном бенчмарке. 🤖Бесплатный ChatGPT