Большая модель думает, маленькая пишет, а между ними Mostik — 4 сентября 2026 г. в 12:07:15.585
Большая модель думает, маленькая пишет, а между ними Mostik Стартап Mostik представил первые результаты работы и дал первое интервью Wired. 15 человек, 12 с PhD, научный директор Станислав Смирнов, филдсовский медалист 2010 года. Компании четыре месяца. Идея началась с простого наблюдения. Чтобы выдать один токен, модель строит около сотни скрытых векторов: примерно миллион чисел, порядка 2 МБ внутреннего состояния. Наружу выходит один элемент словаря на 150 тысяч позиций, около 17 бит, остальное отбрасывается. Все схемы, где модели общаются друг с другом (консилиумы, сабагенты, роутеры), работают через эту щель. Mostik разработал небольшой модуль-переводчик, который передает скрытые состояния напрямую из одной модели в другую. Веса обеих моделей заморожены, учится только мостик, текст между ними не проходит вообще. Заморозка тут принципиальна: если информация проходит без дообучения, значит модели разных семейств уже считают в достаточно похожих пространствах, и мост эксплуатирует структуру, которая там была изначально. В демо GLM-5.2 (753B) читает задачу и останавливается, не написав ни одного токена, всю генерацию делает Qwen-3.5 (4B). Расчет на асимметрию инференса: префилл параллельный и дешевый, декодинг последовательный и дорогой. Результаты по собственным данным компании (бенчмарки в блогпосте не названы): ▪️ связка закрывает 50% разрыва между большой и маленькой моделью ▪️ на сложных подмножествах прирост доходит до 2x ▪️ относительно средней модели с тем же качеством дешевле по вычислениям в 2,5 раза ▪️ против текстовой передачи выигрыш до 10 процентных пунктов, максимальный при ранней передаче, когда большая модель еще ничего не написала Тот же подход компания рассчитывает применить к дистилляции, к специализации маленьких моделей и к мониторингу: латентная передача дает три объекта для анализа (состояние отправителя, его перевод, поведение получателя) и, в отличие от цепочек рассуждений, позволяет вмешиваться в передаваемое состояние и смотреть, что меняется на выходе. Малышева в своем блогпосте рассказывает, что на этом же подходе система вышла на первое место в ARC-AGI (видимо, до выхода GPT-6 Astra) на Kaggle. Деталей нет, соревнование идет, второй чекпоинт 30 сентября. Обидно ровно одно. В заголовке Wired это «российские математики», но деньги дали General Catalyst и Foundation Capital, научный директор двадцать лет профессорствует в Женеве. Вангуем, что юрисдикция у компании Делавера, Нидерландов или что-то подобное. В общем, российская математическая школа никуда не делась, но компании на ее фундаменте снова строят не здесь. @anti_agi

