Харнесс решает всё больше
Харнесс решает всё больше Недавно OpenAI представила GPT-6 Astra и объявила о начале "эры AGI". Один из основных аргументов — новая модель набрала 99,9% на тесте ARC-AGI-3, где ИИ без инструкции учится играть в незнакомые мини-игры. Авторы теста проверяли Astra в стандартной настройке и с адаптером от OpenAI. Результат на одинаковом уровне reasoning вырос с 62,7% до 98,6%, а на высоком — с 54,8% до 99,9%. Почему? Каждый ход в игре — это отдельный запрос к модели. В стандартной настройке модель теряет память о прошлом, как шахматист, который забывает свои ходы. А адаптер от OpenAI позволяет сохранять состояние reasoning, делая связь между ходами более эффективной. Это и есть harness. Мне особенно понравила строчка из их таблицы: в режиме с ВЫКЛЮЧЕННЫМ reasoning модель набрала 96,7%. То есть без глубокого анализа она обошла свою "умную" версию на 30%. Пример с Алисой AI: сейчас она сама выбирает модель под запрос. Для простых вопросов используется быстрая модель, а для сложных, например "Какие вычеты за лечение ребёнка", подключается режим "Эксперт". Около 80% запросов обрабатывает собственная LLM Алисы. Яндекс тестирует различные модели для "Эксперта", и их работа оптимизирована через хArnесс. Зачем это нужно? CEO Алисы Валерий Стромов отметил в Forbes, что для него важны качество и скорость, а также стоимость. Использование мощной модели для каждого вопроса — неоправданные расходы. Благодаря оптимизации Яндекс сэкономил около 9 млрд рублей за полгода. В прошлом посте я упоминал про MoE — модель, выбирающая подсеть-эксперта для каждого слова. Здесь принцип похож, только выбирается целая модель. Моделей всего 3-5, потому что роутер отправляет к нужному специалисту, как регистратура в поликлинике. Почему харнесс важен? На примере запроса "подбери робот-пылесос дешевле 40 тыс., для уборки ковров и шерсти". Модель не знает актуальных цен, поэтому нужна проверка информации: поиск характеристик, отзывов и отсеивание лишнего. Таким образом, вопрос "какая ИИшка умнее?" уже не актуален, в то время как тонкие настройки вокруг ИИ становятся решающими.