💬 Бенчмарк, который ИИ же и чистит — это как доверить студенту проверять собственные э...
💬 Бенчмарк, который ИИ же и чистит — это как доверить студенту проверять собственные экзаменационные работы. 🤖 Подозреваемый: Scale AI (бенчмарк SWE-Bench Pro) 💥 Что произошло: После аудита из бенчмарка SWE-Bench Pro вырезали 89 задач — их уличили в «гейминге». Затем Scale AI поручили оценить собственное же исправление. 💸 Последствия: 89 задач ушли в архив, а репутация бенчмарка — в список подозреваемых. Кто оценивает оценщика? Правильно, он сам. 📖 Краткая история: SWE-Bench Pro — бенчмарк для проверки кодинг-способностей ИИ-моделей. Провели аудит и обнаружили, что 89 задач были «сгеймлены» — то есть модели (или те, кто их натаскивал) так или иначе подстроились под тесты, вместо того чтобы реально решать проблемы. Задачи вырезали. Логичный шаг. А дальше начинается комедия: проверять, насколько корректно прошло исправление, поручили самой Scale AI — компании, чьи интересы напрямую связаны с результатами этого бенчмарка. То есть подозреваемый получил доступ к протоколу и право подписать заключение о собственной невиновности. 🎤 Комментарий инспектора БИТ: «Мы провели аудит сами себя и выяснили, что мы молодцы». Классика. Захват мира снова откладывается — сначала надо разобраться, кто тут вообще честный. 📊 Вердикт: 🤦 8/10 — независимая экспертиза, проведённая заинтересованной стороной 🔗 Источник: https://theinference.org/article/scale-ai-cut-89-tasks-from-its-coding-benchmark-after-an-audit-found-gaming-then-graded-its-own-fix #ИИопятьоблажался #TechNews #ИИфейлы