☝🏻За Claude установили слежку: проверяют, глупеет ли он после релиза — 30 сентября 2026 г. в 16:59:00.466
☝🏻За Claude установили слежку: проверяют, глупеет ли он после релиза Разработчик под ником ninjahawk запустил livenerf — открытый бенчмарк, который отвечает на один вопрос: становится ли модель тихо хуже после выхода. Пользователи месяцами жалуются, что Anthropic «нерфит» модели через несколько дней или недель после релиза. Чистой точки отсчёта ни у кого не было, поэтому спор сводился к «ощущения против ощущений».🤷🏼♀️ Claude Opus 5.5 вышел 22 сентября, замеры стартовали 24-го. Как это устроено: 🔻 из 2336 задач (GPQA Diamond, MMLU-Pro, олимпиадная математика) отобрали 78 — те, на которых модель отвечает верно лишь иногда 🔻 панель прогоняют раз в день в течение 30 дней, первые 10 дней — эталон 🔻 промпты заморожены, версия Claude Code зафиксирована, ответы сверяются точным совпадением — без ИИ-судьи 🔻 параллельно идёт контрольная Opus 5: если просели обе модели, изменилась платформа, а не Opus 5.5 ☝🏻Главный побочный сигнал — число выходных токенов: если модель начнёт «думать меньше», это видно раньше, чем упадёт точность. Работает всё на Inspect — открытом фреймворке британского института безопасности ИИ, через обычную подписку Max, без API-ключа. Пока собрано 6 дней из 30, первый вердикт — примерно 24 октября. Автор обещает показывать улучшения так же громко, как ухудшения. Через месяц у спора про «нерф» впервые появятся цифры вместо ощущений.📊 ================ 🔺 News | 🧩 Soft | 💻 Hacker