В SIGNAL провели эксперимент — проверили один комплект ПД семи разными моделями в разны... — 22 сентября 2026 г. в 14:05:18.151
В SIGNAL провели эксперимент — проверили один комплект ПД семи разными моделями в разных сценариях, в том числе и в их решении — AI Checker. Замечания затем вручную оценивал инженер. Главный вопрос был не в том, сколько замечаний сгенерирует нейросеть, а сколько из них подтвердится, сколько существенных проблем она пропустит и насколько сократится объём ручной проверки. Результаты прогонов: 🟩 GPT-6 Astra — 23 замечания, подтвердилось 21, найдено 13 из 14 контрольных дефектов, подтверждаемость около 91%. 🟩 Лучший прогон GPT-5.6 — 12 замечаний, подтвердились все, но из контрольного набора только 8 из 14. 🟩 Глубокий многоступенчатый анализ — 42 замечания, подтвердилось 31 (10,5 из 14 дефектов, подтверждаемость около 74%). 🟩 Локальная Qwen3-VL 8B — 47 замечаний, подтвердилось примерно одно (0,5 из 14 дефектов, подтверждаемость около 2%) Отдельный вывод: количество замечаний почти ничего не говорит о качестве. Можно получить 47 замечаний с практически нулевой полезностью, а можно — 23, из которых 21 подтверждается. Поэтому важны четыре метрики: сколько реальных проблем найдено, сколько пропущено, сколько создано ложных замечаний и сколько времени инженера удалось сэкономить.