Min-p: метод семплирования для улучшения качества ответов ИИ
Min-p: метод семплирования для улучшения качества ответов ИИ Метод Min-p предлагает решение проблемы, с которой сталкиваются другие методы семплирования, например, top-p и top-k. При их использовании после отсечения токенов всё ещё может оставаться «хвост» из маловероятных вариантов, что повышает риск ошибки в генерации ответа. Min-p динамически настраивает порог отсечения в зависимости от токена с наибольшей вероятностью. Если модель уверена в токене, порог будет высоким, а если сомневается — из распределения возьмётся больше токенов. Алгоритм работает так: сначала определяется токен с наибольшей вероятностью (Pmax), затем базовый порог вероятности (Pbase, обычно между 0,05 и 0,1) умножается на Pmax, формируя порог отсечки (Pscaled). По этому порогу отсекаются маловероятные токены, а оставшиеся используются для семплирования с последующей нормализацией вероятностей. Преимущество Min-p в том, что метод эффективен при разных значениях температуры (например, 3–5), но температуру следует применять после Min-p. Тестирование на модели Mistral 7B показало, что в задачах, требующих креативности (например, в AlpacaEval Creative Writing), Min-p превосходит Top-p, хотя в некоторых других бенчмарках результаты могут быть чуть хуже.