Пять экспертов. Трое систематически строгие, двое точные. Голосование просто считает го... — 13 июля 2026 г. в 05:51:21.886
Пять экспертов. Трое систематически строгие, двое точные. Голосование просто считает голоса - трое побеждают. Совет выдал 0.875: хуже, чем любой из них поодиночке. Дело оказалось не в экспертах, а в том, как склеиваются их мнения. Дали им пересмотреть вердикт, увидев остальных, - 1.000. Через день наткнулся на свежую статью (Kong et al.): SFT даёт модули, а RL должен выучить routing - то, как модули склеиваются. Ровно то место, куда мы уперлись. Приятно дойти самому, а потом найти теорию, которая объясняет почему. Бизнес в том, ГДЕ спорить. Текстовый дебат - 8 секунд на раунд. Латентный, обменом скрытых состояний, - 122 миллисекунды. В 67 раз быстрее и вчетверо точнее по итоговому баллу. 8 секунд - это "подумаем и вернёмся". 122 миллисекунды - это пока кандидат договаривает фразу. Совет успевает поспорить и подсказать следующий вопрос прямо в разговоре. Честно: гипотеза, что в латенте эксперт упрямее держится против большинства, не подтвердилась. Он выигрывает скоростью и точностью, а не упрямством.

