Как проходит пост-тренировка AliceAI-80B-A3B: четвёртый этап
Как проходит пост-тренировка AliceAI-80B-A3B: четвёртый этап Команда разработчиков сообщила о завершении четвёртого этапа пост-тренировки модели AliceAI-80B-A3B. Это продолжение эксперимента по созданию инструктивной модели с нуля — без использования готовых весов и промежуточных результатов обучения. Такой подход позволяет полностью контролировать процесс и изучать влияние каждого этапа на качество. Модель AliceAI-80B-A3B содержит 80 миллиардов параметров, но при обработке каждого токена активируются лишь 3 миллиарда из них. Такая архитектура относится к классу смеси экспертов и позволяет значительно экономить вычислительные ресурсы как при обучении, так и при работе модели. Пост-тренировка включает дообучение на наборе инструкций и выравнивание ответов с предпочтениями пользователей. На четвёртом этапе основное внимание уделялось улучшению способности модели следовать сложным многошаговым инструкциям и снижению числа фактических ошибок. По предварительным оценкам, модель стала заметно стабильнее на тестах, требующих рассуждений и работы с большим контекстом. Разработчики отмечают, что впереди ещё несколько этапов, включая финальную настройку безопасности и оценку на открытых тестах. Этот проект интересен тем, что показывает возможность построения сильной инструктивной модели с нуля при ограниченных вычислительных ресурсах. Благодаря архитектуре с активными 3 миллиардами параметров, модель может работать на оборудовании, недоступном для полных 80-миллиардных моделей, сохраняя при этом большую часть качества. Главное: • Модель AliceAI-80B-A3B обучается с нуля без готовых весов • Архитектура смеси экспертов активирует только 3B из 80B параметров • Четвёртый этап пост-тренировки улучшил следование инструкциям • Модель может работать на менее мощном оборудовании #ИИ #LLM #OpenSource #Нейросети