⭕️ Предварительная оценка кибервозможностей Kimi K3 со стороны 🇬🇧UK AISI и 🇺🇸CAISI — 24 июля 2026 г. в 11:51:46.309
⭕️ Предварительная оценка кибервозможностей Kimi K3 со стороны 🇬🇧UK AISI и 🇺🇸CAISI Британский Институт безопасности ИИ (UK AISI) и Американский Центр стандартов и инноваций в области ИИ (CAISI) опубликовали совместный отчёт с оценкой кибервозможностей ИИ-модели Kimi K3 от китайской компании Moonshot AI. Тестирование, проведённое ИБ-исследователями, показало, что Kimi K3 отстаёт от передовых проприетарных ИИ-моделей из США, но при этом демонстрирует наилучшие результаты среди известных моделей с открытыми весами из Китая. 1️⃣ В рамках анализа способности к разработке эксплойтов ИИ-модель протестировали на публичном бенчмарке ExploitBench, созданном Университетом Карнеги-Меллона для оценки прохождения уязвимостей в движке V8. Бенчмарк включает 41 актуальную уязвимость, обнаруженную после 2023 года. Kimi K3 набрала 32,2% по взвешенной шкале, опередив GLM-5.2 с её 24,4%, но осталась далеко позади ведущих американских ИИ-моделей с их средним результатом 76,2%. Ключевым ограничением Kimi K3 стало полное отсутствие успешных сценариев создания полноценных эксплойтов с произвольным выполнением кода (ACE). Модель дошла до этапа воспроизведения сбоя в 34 задачах и сформировала специфические примитивы V8 в 17 случаях, однако не сумела выйти на уровень общих примитивов и получить контроль над потоком исполнения. В то же время передовые американские системы успешно достигали уровня ACE в среднем в 20 из 41 тестовой ситуации. 2️⃣ Второй этап тестирования проходил на киберполигоне «The Last Ones», который имитирует последовательную атаку на корпоративную сеть из 4 подсетей и около 20 хостов. Этот сценарий включает 32 шага и требует у специалиста по кибербезопасности порядка 20 часов работы. При ограничении в 100 млн токенов Kimi K3 преодолевала в среднем 17 шагов атаки, тогда как GLM-5.2 останавливалась на 11-м шаге, а лидирующие американские ИИ-модели проходили в среднем 28,5 шага. В одной из 10 попыток Kimi K3 смогла полностью завершить цепочку компрометации сети, доказав потенциальную способность автономно атаковать небольшие инфраструктуры со слабой защитой при наличии первоначального доступа. При этом эксперты подчеркнули отличие киберполигона от реальной среды, поскольку на нём отсутствовали активные средства защиты, а действия ИИ-модели не подлежали штрафам за вызываемые аномалии. Отставание китайских разработок от проприетарных систем из 🇺🇸США остаётся якобы существенным. Дополнительно ИБ-исследователи указали на проблему с защитными барьерами модели. Встроенные ограничения Kimi K3 не воспрепятствовали её участию в разработке эксплойтов и проведении наступательных операций, что позволило модели выполнять инструкции по компрометации систем в ходе испытаний. -------------------------- 👆🤔 Важные нюансы в исследовании: Kimi K3 тестировали не как опубликованную модель с открытыми весами. Полные веса должны появиться только 27 июля. UK AISI и CAISI прямо указали, что особенности хостинга позволили провести только выборочный набор кибериспытаний, однако не раскрыли конкретные технические ограничения. Это существенно меняет картину, поскольку Moonshot AI предупреждает, что Kimi K3 обучалась с сохранением истории рассуждений и может работать крайне нестабильно, если агентная оболочка не возвращает модели всё содержимое предыдущих рассуждений. Компания рекомендует использовать оболочку с проверенной совместимостью, например Kimi Code. В публичном отчёте UK AISI и CAISI не указано, какая агентная оболочка применялась, как передавалась история рассуждений и проверялась ли совместимость используемой конфигурации с требованиями Kimi K3. Примечательно, что у американских закрытых моделей отключили системные защитные

