Как сохранить стабильность гиперпараметров при масштабировании моделей
Как сохранить стабильность гиперпараметров при масштабировании моделей При масштабировании моделей важно сохранять стабильность гиперпараметров. Это позволяет настраивать их на небольших моделях, экономя ресурсы, которые потребовались бы для обучения крупных моделей. В недавних публикациях предложены методы решения этой задачи. Авторы статьи Tensor Programs V предлагают метод Maximal Update Parametrization (μP), который позволяет переносить параметры с маленькой модели на большую без дополнительной настройки. Традиционные методы параметризации часто приводят к изменению оптимальных гиперпараметров при увеличении масштаба сетей, но есть способы этого избежать. Для сохранения стабильности гиперпараметров необходимо правильно масштабировать спектральную норму матриц весов — показатель максимально возможного растяжения или сжатия вектора при умножении на матрицу. Этого можно достичь двумя способами: правильным масштабированием инициализаций и послойных LR либо спектральной нормализацией матриц весов и их обновлений в процессе обучения. В статье A Spectral Condition for Feature Learning предполагается, что обновления весов в градиентном спуске имеют низкий ранг и хорошо согласуются с векторами активаций. Однако это не всегда так, и в статье Scaling Exponents Across Parameterizations and Optimizers авторы предлагают усовершенствовать метод с учётом этого нюанса.