Разработчики Xiaomi выпустили модель CocktailASR-1 для распознавания речи! ☝ — 11 сентября 2026 г. в 12:57:14.966
Разработчики Xiaomi выпустили модель CocktailASR-1 для распознавания речи! ☝ Компания Xiaomi выпустила и открыла исходный код Xiaomi-CocktailASR-1, модели распознавания речи, разработанной для решения одной из самых сложных задач в аудиотранскрипции: выделения голоса одного человека, когда одновременно говорят несколько человек. Xiaomi называет это «проблемой коктейльной вечеринки». Большинство моделей распознавания речи хорошо работают, когда говорит только один человек, но ситуация значительно усложняется, когда несколько голосов перекрываются. Эта задача похожа на ту, которую Xiaomi решала с помощью своей модели преобразования текста в речь OmniVoice, хотя CocktailASR-1 работает в обратном направлении, выделяя и расшифровывая речь, а не генерируя её. Все подробности 👉 здесь