ГБОУ Уфимская УКШИ №28 для слепых и слабовидящих обучающихся
Образование · 8 сентября 2026 г.
Рәсәй халыҡтары телдәре көнө! — 8 сентября 2026 г. в 09:28:25.567
Рәсәй халыҡтары телдәре көнө! Хөрмәтле дуҫтар! Работа по цифровизации башкирского языка идёт системно и высокими темпами. Недавно мы сообщали о создании межведомственной рабочей группы vk.ru/wall1316249_6987 Наша задача — не просто собирать данные, но и методично решать вопросы авторских прав, чтобы делать качественные массивы данных открытыми для разработчиков. Вслед за успешной публикацией аудиокниг на Hugging Face, организации-участники группы выложили сразу два новых открытых датасета — для текста и для аудио. Что нового появилось в нашем репозитории bashkorttele: 1. Параллельный корпус разговорников Ценнейший ресурс для машинного перевода (NMT), многоязычных эмбеддингов и кросс-языковых задач между башкирским, русским и родственными тюркскими языками (а также арабским и китайским). 🔹 Объём: 9 857 фраз, выровненных сразу по трём языкам: башкирский + русский + третий язык (алтайский, арабский, казахский, якутский или китайский). 🔹 Формат: каждая языковая пара выделена в отдельный конфиг и файл для удобства загрузки. 🔗 Ссылка: huggingface.co/datasets/b... 🎙 2. Корпус теле- и радиоречи К инициативе подключились региональные телерадиокомпании Башкортостана, предоставив архивы своих программ. Для low-resource языков десятки часов чистой естественной речи из эфира — это буквально на вес золота! 🔹 Объём: 53,3 часа живой башкирской речи (293 аудиозаписи). 🔹 Формат: чистый звук без текстовых расшифровок (audio-only). 🔹 Зачем нужно: это идеальный фундамент для предобучения речевых моделей без учителя (self-supervised learning), таких как архитектуры Wav2Vec 2.0, HuBERT или для тонкой настройки (fine-tuning) моделей вроде Whisper. 🔗 Ссылка: huggingface.co/datasets/b... Меня очень радует такой темп. На практике мы видим, как институты из нашей рабочей группы — университеты, медиахолдинги, архивы — один за другим вносят свой вклад в общую цифровую копилку. Мы методично собираем полноценный стек данных для обучения современных языковых и речевых моделей. Обращаюсь к IT-сообществу, лингвистам и разработчикам: берите эти данные в работу, тестируйте и обучайте свои модели! Вместе мы делаем башкирский язык конкурентоспособным и востребованным в эпоху искусственного интеллекта. Артабан тик АЛҒА!

