🚫 СТОЙТЕ, ГИГАЧАТ ХОЧЕТ ОТВЕТИТЬ — 14 июля 2026 г. в 11:59:33.022
🚫 СТОЙТЕ, ГИГАЧАТ ХОЧЕТ ОТВЕТИТЬ Мы выложили в Open Source сразу две модели для работы со звуком: audio-native LLM GigaChat Audio и мультиязычное SOTA-распознавание речи GigaAM Multilingual. Обе работы приняты на Interspeech 2026 — главную мировую конференцию по речевым технологиям 🔥 Чем силён GigaChat Audio? 🎧 Понимает длинные записи Держит контекст до 2 часов аудио и свободно ориентируется внутри: находит момент, где обсуждали нужную тему, пересказывает фрагмент, собирает саммари с таймкодами. На записях 20–60 минут точность локализации событий — 48.3 IoU против ~0 у Voxtral, Phi-4 и Qwen3-Omni 🎧 Считывает эмоции По интонации и манере речи распознаёт настроение говорящего — 90%+ на бенчмарке Dusha — и учитывает его в ответе 🎧 Распознаёт русский на слух лучше аналогов RuBQ-Audio: 60,0 против 43,7 у Qwen3-Omni. А ещё — multi-turn диалог, перевод, классификация аудио и распознавание речи в одной модели GigaAM Multilingual — расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский. Компактная версия на 240M параметров обгоняет Whisper Large v3 и Omnilingual 1B, а аудиоэнкодер, предобученный на 2 млн часов речи на 70+ языках, адаптируется к новым языкам с минимумом данных: на грузинском и башкирском хватило одного Common Voice, чтобы дойти до WER ~4% против 11%+ у Whisper Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026 Модели уже работают в ГигаЧате: общайтесь голосом, присылайте голосовые сообщения и аудиофайлы. Разработчикам предлагаем забрать GigaChat Audio и GigaAM Multilingual в Open Source вместе с датасетом TimeGround-1M А если интересна техническая часть, читайте пост команды ↖️

