OpenAI забраковала главный тест для программирующих нейросетей — 9 июля 2026 г. в 15:14:21.483
OpenAI забраковала главный тест для программирующих нейросетей Менее пяти месяцев назад компания раскритиковала популярный бенчмарк SWE Bench Verified и призвала разработчиков использовать версию Pro. Теперь OpenAI провела аудит новой версии и выяснила, что она тоже не работает. Проблема кроется в самих заданиях. Задачи из открытых репозиториев создавались для людей. Они предполагают долгие обсуждения и уточнения. Для изолированной проверки искусственного интеллекта такой формат совершенно не подходит. Ручная проверка выявила ошибки в 249 задачах. Это составляет более 34 процентов от общего числа. В некоторых случаях тесты слишком строгие и бракуют рабочий код на основании неуказанных в условии деталей. В других ситуациях проверки настолько слабые, что пропускают неполные решения. Также встречаются вводящие в заблуждение условия, которые прямо противоречат правильным ответам. Учитывая такое количество брака OpenAI официально отзывает свою рекомендацию. Компания призывает сообщество создать совершенно новые инструменты оценки. Показательно. Индустрия достигла предела старых методов тестирования. Использовать человеческие задачи из открытого кода для проверки алгоритмов больше не получается. Рынок остро нуждается в новых метриках, которые изначально созданы специально для искусственного интеллекта.

