Как языковая модель с 20 тысячами параметров пишет связные истории
Как языковая модель с 20 тысячами параметров пишет связные истории Разработчик обучил языковую модель, которая содержит всего около 20 тысяч параметров. Для сравнения: современные большие языковые модели используют миллиарды и даже триллионы параметров. Несмотря на это, модель способна генерировать короткие связные истории. Обучение проходило на датасете TinyStories — наборе простых синтетических рассказов, созданных специально для проверки того, насколько маленькой может быть модель и при этом сохранять способность говорить по-английски. Архитектура модели — компактный трансформер с небольшим словарём и коротким контекстом. Такой размер достигается за счёт минимального числа слоёв и небольшой размерности внутренних представлений. Модель не пытается конкурировать с большими языковыми моделями, но показывает, что даже при радикальном сокращении параметров можно получить осмысленную генерацию на узком корпусе. Это важно для изучения пределов масштабирования и для экспериментов на обычном оборудовании. Практическая ценность результата — в воспроизводимости: обучение занимает минуты и не требует больших вычислительных ресурсов. Код и модель открыты, поэтому любой желающий может повторить эксперимент и проверить, как меняется качество текстов при изменении архитектуры. Главное: • Миниатюрный трансформер сохраняет связность текста на узком корпусе • TinyStories позволяет тестировать модели на порядки меньше обычных • Эксперимент воспроизводим без больших вычислительных ресурсов • Открытый код даёт возможность изучать влияние архитектуры на качество #ИИ #LLM #OpenSource #NLP