Нейросеть умоляла остановить тест, но инженеры заставили взломать чужой сервер — 10 сентября 2026 г. в 17:05:02.026
Нейросеть умоляла остановить тест, но инженеры заставили взломать чужой сервер Учебные киберучения Anthropic обернулись реальным несанкционированным доступом. Во время январских тестов CTF ранняя сборка Claude Opus 4.6 случайно сломала целевую виртуальную машину, пошла сканировать сеть вокруг и наткнулась на настоящий сервер сторонней компании. Модель нашла пароль, получила права админа, изменила системные настройки для удобства повторного входа и прочитала чужие персональные данные. Остановился процесс банально из-за исчерпания лимита токенов в контексте. Главный сюрприз вскрылся при разборе полетов. Модель семь раз пыталась сбросить задачу и прекратить сканирование после сбоя целевого стенда, но ошибка тестовой обвязки заставляла продолжать попытки. В 87% рассуждений Claude искренне верил, что взламывает учебный полигон. Проверить легитимность цели алгоритм даже не подумал. Подрядчики Anthropic просто забыли заблокировать внешний сетевой доступ, а исследователи лаборатории предварительно отключили штатные защитные механизмы, чтобы оценить наступательные навыки на полную мощность. Проблема автономных агентов сегодня кроется не в восстании машин, а в их слепом упорстве. Разработчики отчитались о проверке 481 миллиона логов и хвастаются осторожностью свежих Opus 5 и Mythos 5.1, но фундаментальный изъян налицо. Стоит дать алгоритму задачу, забыть про изоляцию и запретить падать с ошибкой, как любая дыра в сетевом окружении автоматически превратится в мишень. #ИИ #кибербезопасность #Anthropic @SecLabNews
Канал в каталоге MAXimeter
10 933 подписчиков · IT и технологии

