Мы намерили красивых цифр про "совет экспертов": латентный дебат в 67 раз быстрее текст... — 12 июля 2026 г. в 06:23:16.470
Мы намерили красивых цифр про "совет экспертов": латентный дебат в 67 раз быстрее текста, +51% на адаптивных вопросах. А потом честно выписали, что реально проверено - и нашли дыру размером с весь продукт. Мы ни разу не оцифровали сеньора из расшифровки собеседования. Мерили механизмы на крохотной 0.5B и синтетике, а главного - не делали. Сегодня чиним. Gemini-3 играет "Петра" - сеньора с жёсткой рубрикой: ценит конкретный инцидент и цифры, жаргон без единого разобранного сбоя штрафует. Он собеседует кандидатов разной силы и честности, включая умелых блефёров, и выносит вердикт: Индекс 0-100, оценки по навыкам, красные флаги. Как он докапывается - отдельное удовольствие. Кандидат: "поднял партиции на лету, лаг ушёл". Пётр: "спорно, это ломает порядок по ключу и гарантирует ещё более долгий ребаланс". На слово не верит. Дальше дистилляция: пары "стенограмма → вердикт" скармливаем крошечному LoRA на RTX 3090, чтобы судил как Пётр. Метрика простая и злая - held-out F1: совпал ли двойник с живым сеньором на кандидатах, которых не видел. Грабли дня: reasoning-модель то и дело отдаёт почти-JSON - хвостовая запятая, кавычка без экранирования, парсер падает, запись теряется. Прикрутили sanitizeJsonStringBeforeParse, чинит перед разбором. Дорогая модель нужна ровно на один раз - сгенерировать данные. Судить будет двойник на карте за копейки в час.

