Распознать «Алиса» не так просто, как кажется — 6 июля 2026 г. в 10:01:29.921
Распознать «Алиса» не так просто, как кажется Имя служит фразой-активацией для устройств с Алисой — услышав «Алиса», они начинают распознавать речь, чтобы обработать команды. Само обращение ловит споттер — локальная модель, которая работает без интернета и существует для единственной цели: услышать то самое «Алиса». Споттер работает постоянно и потребляет энергию, но для Станций это не проблема, заряда и мощностей достаточно. Дропс — маленькое устройство с небольшим аккумулятором, а модель споттера не помещалась в память, так что разработчикам Яндекса пришлось изобретать. Для начала в наушники добавили NPU — процессор, оптимизированный для быстрой и эффективной работы нейросетей. Он тратит меньше энергии и может питать модель, но его память сильно ограничена: всего 208 кб, а споттер из колонок весит 1,7 мб. Поэтому его нужно было сжать, и это сделали в три этапа: 🔸 Дистилляция — большая модель-«учитель» из колонок обучила маленькую модель-«ученика». Та переняла поведение, не копируя архитектуру 🔸 Глубинная разделимая свёртка (DSC) — ищет закономерности в каждом канале звука по отдельности, а затем смешивает в один результат. Это уменьшает количество вычислений и размер модели, почти не снижая точность 🔸 Квантование — модель перевели из 32-битного формата в 8-битный: размер сократили в 4 раза почти без потери точности. Споттер получилось уместить в 200 кб, но держать его всегда активным на небольшой батарее Дропсов оказалось затратно даже для NPU. Поэтому разработчики пошли дальше и придумали, как сократить нагрузку споттера на батарею в 10 раз. Для начала они обучили наушники работать «посменно» — пока левый распознаёт команды, правый не тратит на это энергию и наоборот. А ещё споттеру дали помощника: лёгкий алгоритм детекции человеческой речи VAD. В итоге споттер работает так: Споттер «спит» ➡️ VAD слышит, что рядом кто-то говорит ➡️ споттер просыпается и проверяет, сказал ли кто-то «Алиса» или другую команду наушникам ➡️ если да, включается распознавание речи ➡️ с точки зрения пользователя не прошло и секунды. При этом споттер всё ещё можно сделать лучше. В будущем разработчики планируют научить его не срабатывать на чужие голоса (например, объявления в метро), а сложные случаи срабатывания перепроверять на смартфоне. Подробнее об этом читайте на «Хабре». Подписывайтесь 👉 @techno_yandex

