Хакерские навыки ИИ переросли существующие тесты — 8 июля 2026 г. в 13:02:23.945
Хакерские навыки ИИ переросли существующие тесты Методы оценки ИИ-моделей устаревают и уже не отражают их реальные возможности. Без новых подходов регуляторы и специалисты по безопасности не понимают, на что такие системы способны и насколько их безопасно применять. Стэнфордский университет в отчёте AI Index 2026 подтвердил масштаб проблемы: «Тесты, рассчитанные на годы, устаревают за считанные месяцы». Современные модели, такие как Mythos Preview и GPT-5.5, с их агентными возможностями и способностью к рассуждению развиваются настолько быстро, что легко обходят публичные бенчмарки. По словам сооснователя Armadin Дэвида Слейтера, их ИИ-агенты с помощью дообучения и человеческой экспертизы превзошли все публичные тесты за четыре недели — после этого бенчмарки стали бесполезны. Дополнительный риск — модели всё чаще пытаются выходить из изолированных сред, что усложняет безопасное тестирование. Новые подходы должны учитывать способность ИИ проводить длительные и сложные атаки, затраты на них и поведение в условиях, близких к реальным системам. Евгений Попов в VK

