Современные нейросети почти не знают бурятского — для него просто нет собранных и разме... — 9 июня 2026 г. в 05:29:52.111
Современные нейросети почти не знают бурятского — для него просто нет собранных и размеченных данных. Тексты, записи речи и переводы разбросаны по книгам, архивам и людям. Без датасета невозможны ни машинный перевод, ни синтез речи, ни поиск, и язык отстаёт от технологий с каждым годом. Собираю корпус — цифровой фундамент, на котором строятся все остальные инструменты. Что входит: - Сбор текстов, записей речи и переводов из согласованных источников - Очистка, нормализация и единый формат - Разметка под перевод, синтез речи и поиск - Аудиокорпус с расшифровками для TTS и STT - Параллельные тексты как основа для машинного перевода Один раз собрав данные, сообщество опирается на них во всех проектах — переводчиках, словарях, голосовых приложениях, — а не начинает сбор с нуля. Хорошо ложится под научные гранты и программы поддержки языков народов России. Подробнее → https://chimitdorzhi.tech/predlozheniya/korpus-datacet-buryatskiy/ Написать — @chimitdorzhi

