BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели после ре... — 2 октября 2026 г. в 16:04:59.899
BridgeMind сделали бенчмарк, чтобы измерять, не ухудшают ли лаборатории модели после релиза Пользователи чат-ботов и агентов регулярно замечают, что после релиза — или перед выходом следующей версии — модели будто начинают работать хуже. Такое предполагаемое искусственное ослабление называют «нёрфом». Чтобы отслеживать подобные изменения, BridgeMind выпустили NerfBench — набор сравнительных тестов. В день релиза результат модели принимают за 100%, а затем периодически повторяют замеры. Система оценивает не только качество ответов, но и расход токенов и стоимость выполнения той же задачи. Диапазон 90–110% считается нормальным статистическим разбросом. Падение ниже 90% помечается как подозрительное. Если прежняя задача требует больше токенов или денег, это тоже считается потерей мощности. Сейчас пользователи жалуются на заметное ухудшение Opus 5.5. Очередной замер NerfBench показал около 94% от стартового результата. Формально это всё ещё нормальный диапазон, однако, по наблюдению авторов бенчмарка, другие протестированные модели настолько не ослабли. Пользователи X связывают это со скорым выходом Fable 5.5, но пока это лишь их предположение. Следить за замерами NerfBench можно на сайте проекта. BridgeMind также пообещали направить $10 000 на будущие перепроверки: список моделей расширят, а тесты станут проводить чаще. Следить за замерами NerfBench: https://bridgebench.ai/nerf-bench Источник: https://t.me/data_secrets/10088 #RealVibe #AI #AI_Новости