Сегодня в 18:00 по Москве Qwen выкладывает Qwen3.8-Flash-Next, первую модель на архитек... — 26 августа 2026 г. в 14:05:25.110
Сегодня в 18:00 по Москве Qwen выкладывает Qwen3.8-Flash-Next, первую модель на архитектуре Qwen4. Официально известно мало: мультимодальная MoE, архитектуру следующего поколения выпускают заранее, чтобы сообщество успело подготовить движки и кванты к полному семейству Qwen4. Два артефакта, обычный и FP8. На HuggingFace больше 2,6 тысяч человек нажали «ждать релиза», QwenDevs утром подтвердили название. Слухи такие. В первой версии карточки на ModelScope, которую потом урезали, стояло: MoE, 6 млрд активных из 125, плюс отдельная таблица N-gram-эмбеддингов ещё на 51 млрд, гибрид Gated DeltaNet и Qwen Sparse Attention, обучение примерно в 9 раз дешевле при уровне Qwen3.7-Plus и лучше в кодинге. Скриншоты разошлись по форуму NVIDIA и r/LocalLLaMA, но часть народа сомневается: у Qwen3.5 и 3.6 «Flash» означал 35B-A3B, а надёжного источника на 125B нет. Про N-gram-таблицу гадают, что это встроенный черновик для спекулятивного декодирования, отсюда и «Lightning-Fast» в слогане. Если цифры верные, на форумах прикидывают, что модель под Mac на 96–128 ГБ, DGX Spark и Strix Halo: 4-битный квант основных весов влезает под 80 ГБ, FP8 требует двух GB10. Официальных бенчмарков нет ни одного, так что любой таблице до релиза верить рано. Вчера ещё LMArena показала, что Qwen3.8-27B первая среди открытых в Image-to-WebDev Arena, 1574 балла и седьмое место в общем зачёте, рядом с Kimi K3 Max на 2,8 трлн параметров. @neuro_channel

