Microsoft Research открыла VibeVoice-ASR-Streaming, потоковое распознавание речи, котор... — 5 сентября 2026 г. в 10:27:10.459
Microsoft Research открыла VibeVoice-ASR-Streaming, потоковое распознавание речи, которое сразу пишет, кто что сказал, без отдельного этапа диаризации. Модель принимает звук кусками фиксированной длины с небольшим заглядыванием вперёд и выдаёт реплики с метками спикеров по ходу разговора. Можно передать список имён и терминов, чтобы она их не коверкала. Десять языков, русский в списке. По доле ошибок распознавания (WER для слов, CER для китайских иероглифов) 7B-версия в среднем лучше Gemini 3.5 Transcribe Live, ElevenLabs Scribe v2 Realtime и потоковых моделей OpenAI на пяти наборах записей встреч, хотя на двух Gemini впереди, график на картинке. По атрибуции спикеров лучший или равный лучшему результат в 12 из 13 настроек. Веса версий с бэкбонами 1,5B и 7B под MIT, код на GitHub, отчёт на arXiv, есть демо. @neuro_channel

