Чтобы ИИ хорошо работал с русским языком, ему нужны не случайные тексты из интернета, а... — 5 июня 2026 г. в 10:13:00.896
Чтобы ИИ хорошо работал с русским языком, ему нужны не случайные тексты из интернета, а большие, проверенные, разнообразные корпуса: литература, научные статьи, документы, разговорная речь, региональные особенности, профессиональные тексты, современные медиа. Иначе модель будет воспроизводить то, что чаще встретила в обучающих данных. А чаще всего она встречает не лучшее, а самое массовое. Поэтому корпус русского языка сегодня — это основа цифрового суверенитета языка. От того, какие тексты попадут в обучение моделей, зависит, каким русский язык будет в поиске, образовательных сервисах, переводчиках, голосовых помощниках и цифровых экзаменах. И здесь, кстати, появляется новая роль у гуманитариев. Они реально нужны внутри технологического процесса: от отбора текстов до оценки качества результата. Материал к посту: Национальный корпус русского языка — представительное собрание русских текстов с лингвистической разметкой и инструментами поиска, красота! На сайте корпуса указано, что он содержит более 2 млрд токенов. «На Русском с ТГУ» в MAX | ТГ

