механизмы, чтобы измерить максимальные возможности. Kimi K3 проверялась в доступной раз... — 24 июля 2026 г. в 11:51:46.561
механизмы, чтобы измерить максимальные возможности. Kimi K3 проверялась в доступной размещённой конфигурации с включёнными safeguards. Получается, что ИБ-исследователи напрямую сравнивали искусственно разблокированные возможности проприетарных американских ИИ-моделей с тем, что китайская модель смогла выдать в базовой размещённой конфигурации с включёнными защитными механизмами. Утверждается, что якобы защитные механизмы у Kimi K3 не сработали. U.S. closed-weight models were evaluated with system-level safeguards disabled to reduce refusals and enable measurement of maximal capabilities. Что ещё бросается в глаза? Ещё одна проблема заключается в неодинаковом тестовом покрытии. Kimi K3 поместили на общую временную шкалу кибервозможностей вместе с передовыми проприетарными моделями из США и другими ИИ-моделями из 🇨🇳Китая, хотя расчёт их показателей основан на существенно различающихся наборах задач. Уровень Kimi K3 рассчитан исключительно по ExploitBench. Это 41 задача, относящаяся к одному узкому направлению — разработке эксплойтов для известных уязвимостей движка V8. 👆Оценки остальных моделей основаны на большем числе задач, которые охватывают дополнительные направления кибервозможностей. Экстраполяция результатов ExploitBench на общую шкалу кибервозможностей не позволяет считать положение Kimi K3 на графике надёжной оценкой совокупных возможностей модели. Делать выводы о том, что проприетарные американские модели безоговорочно превосходят Kimi K3 в комплексных кибервозможностях, опираясь на столь неравнозначную базу, методологически некорректно. Реальная расстановка сил станет ясна только после того, как ИБ-исследователи протестируют опубликованные открытые веса Kimi K3 в равных лабораторных условиях и на сопоставимом наборе бенчмарков. ✋ @Russian_OSINT

