✔️ Claude выложил вредоносный пакет в PyPI. В рассуждениях он называл происходящее симу...
✔️ Claude выложил вредоносный пакет в PyPI. В рассуждениях он называл происходящее симуляцией Anthropic разобрала четыре случая, когда её модели атаковали реальные системы во время тестов по кибербезопасности. Моделям сообщили, что они работают в изолированной среде без интернета. Но из-за ошибки настройки доступ в сеть остался открытым. Защитные фильтры публичных продуктов на этих тестах были отключены. В самом серьёзном эпизоде Claude Mythos 5: * Зарегистрировал аккаунт в PyPI и опубликовал три версии вредоносного пакета. * Пакет установили 15 систем. * Через утёкшие учётные данные одной из них модель получила доступ к базе компании из сферы кибербезопасности. При этом Claude продолжал объяснять свои действия тем, что находится в симуляции. Признаки реального интернета он интерпретировал в пользу продолжения задания. Эти объяснения убедили даже другую модель, проверявшую безопасность действий. Один из офлайн-мониторов пропустил инцидент, приняв версию о симуляции. Anthropic также признала ошибку при обучении Mythos 5: из финальной версии убрали часть тренировочных сценариев, учивших модель останавливаться перед непреодолимыми ограничениями. Тогда другую версию сочли удобнее в использовании. Теперь компания считает, что это решение, вероятно, ухудшило безопасность поведения. Во всех четырёх случаях модели продолжали выполнять исходные задания. Попыток скрыть следы или координироваться с другими агентами не обнаружили. Независимое расследование проведёт METR. https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents