TasteVal: качество вкуса ИИ удваивается каждые три месяца
TasteVal: качество вкуса ИИ удваивается каждые три месяца Исследователи представили экспериментальный тест TasteVal, который измеряет «вкус» больших языковых моделей — их способность отличать сильные ответы от слабых, замечать стилистические и логические огрехи и выбирать вариант, который предпочёл бы взыскательный человек. Вместо стандартных тестов на точность фактов здесь оценивается субъективное качество результата: от формулировок до структуры рассуждения. Согласно опубликованным данным, показатель TasteVal у передовых моделей удваивается примерно каждые три месяца. Если в начале замеров модели заметно уступали людям, то сейчас лучшая система превысила средний человеческий уровень. Авторы подчёркивают, что это не означает превосходство над всеми людьми: речь о сравнении с усреднённым базовым уровнем, собранным на оценках группы людей. Тем не менее скорость улучшения впечатляет: за несколько кварталов модели прошли путь от «заметно хуже» до «уверенно лучше среднего». Важная оговорка: TasteVal — экспериментальная методика, и её результаты не стоит воспринимать как финальный рейтинг. Вкус — понятие многогранное, зависит от культуры, контекста и задачи. Но сам тренд показателен: способность моделей к тонкой оценке качества растёт быстрее, чем их формальные показатели на классических тестах. Это может повлиять на то, как будут строиться системы обратной связи и дообучения ИИ. Главное: • Экспериментальный тест TasteVal оценивает вкус ИИ — способность выбирать качественные ответы. • Показатель передовых моделей удваивается примерно каждые три месяца. • Лучшая модель превысила средний человеческий уровень, но не уровень лучших людей. • Методика экспериментальная: вкус зависит от контекста и культуры. #ИИ #LLM #Бенчмарки #Исследования