NVIDIA выложила Nemotron 3.5 ASR Streaming, потоковое распознавание речи всего на 0,6B ... — 13 июня 2026 г. в 07:35:18.969
NVIDIA выложила Nemotron 3.5 ASR Streaming, потоковое распознавание речи всего на 0,6B параметров. В дайджесте упоминал её мельком, но релиз заслуживает отдельного поста: один чекпоинт держит 40 языков включая русский, а лицензия открытая и разрешает коммерческое использование. Фишка в архитектуре cache-aware streaming: каждый кусок аудио обрабатывается один раз, без постоянного пересчёта буфера. Отсюда плотность, на одной H100 модель тянет 240 параллельных потоков против 14 у Parakeet. Задержку можно крутить от 80 мс до 1,1 секунды прямо на инференсе, у русского WER около 9% на длинном чанке. В свежем независимом исследовании Microsoft она показала лучший потоковый WER и самую низкую задержку среди протестированных моделей, включая Parakeet и Qwen3-ASR. Качество может и не топовое из всех моделей вообще, но по балансу скорости и качества для русского — прям очень хорошо. Пунктуация и заглавные буквы на месте, слышит всё чётко, для пост-обработки с ИИ получается отличный транскрипт, рекомендую. А ещё язык умеет сама определять сразу же, без отдельного LID, что тоже удобно, чтобы быстро понять о чём любая аудиозапись, например. @neuro_channel

