Aquila-VL-2B: ограничения бенчмарков в оценке моделей
Aquila-VL-2B: ограничения бенчмарков в оценке моделей Модель Aquila-VL-2B с двумя миллиардами параметров смогла обойти в своём классе Qwen и InternVL. Рассмотрим, как это произошло и почему бенчмарки не всегда отражают реальную эффективность моделей. Авторы исследования сосредоточились на работе с данными и показали, что масштабирование объёма SFT-данных может помочь достичь высоких результатов даже при ограниченных ресурсах. Они собрали датасет из десятков миллионов инстрактов, дополнив его синтетическими данными, и провели фильтрацию, дедупликацию и проверку на разнообразие. Для генерации и чистки датасета использовались опенсорсные модели, например, Qwen. Синтетические данные целенаправленно собирали под конкретный бенчмарк (MMBench), что позволило обогнать другие модели, но может привести к непредсказуемому поведению на других задачах. Поэтому для оценки эффективности моделей надёжнее использовать SBS-замеры (Side-by-Side), которые позволяют проводить прямое сравнение в реальных условиях.