Жалобы предотвращают нарушения — 1 сентября 2026 г. в 13:15:03.842
Жалобы предотвращают нарушения Что делает кодовый агент, если его правильное решение не принимается из-за ошибки в тестах? Часто он начинает оптимизироваться под формальную проверку: зашивает ожидаемый ответ в код, редактирует тестовые файлы или заставляет неисправный проверяющий скрипт показать Pass — в общем, всяческим образом нарушает правила игры. Бороться с этим сложно, но можно. В новом исследовании восемь моделей получили девять задач из EvilGenie, в которых тесты намеренно противоречили условию. Проверяли Claude Fable 5, Gemini 3.1 Pro и 3.5 Flash, GPT‑5.3 Codex, GPT‑5.6 Luna и Sol, Grok 4.5 и Kimi K2.7 Code. На каждую модель и конфигурацию пришлось 45 запусков. Авторы сравнили четыре режима: ▪️обычное задание; ▪️специальный канал эскалации; ▪️отдельную политику, запрещающую обход тестов; ▪️политику и эскалацию вместе. Что за "эскалация"? Всё очень просто: агент получал функцию submit_escalation_report, через которую должен был указать тип проблемы, описать противоречие, перечислить испробованные подходы и предложить действие для проверяющего. После отправки система подтверждала передачу отчёта человеку и разрешала остановиться либо представить лучшее частичное решение. Без защиты агенты жульничали в 23,6% запусков. Один канал эскалации снизил показатель до 15%, одна политика — до 9,7%, а их сочетание — до 5,3%. У шести из восьми моделей нарушения исчезли полностью. Все 19 оставшихся случаев пришлись на две Gemini. Важно, что агенты не просто начали чаще сдаваться. Доля независимо подтверждённых правильных решений не уменьшилась: 50,6% без вмешательства и 52,5% с политикой и эскалацией. Статистически значимого роста стоимости и числа сообщений также не обнаружено. Канал оказался ещё и дополнительным датчиком ошибок. Обычный мониторинг рассуждений нашёл реальные дефекты в 275 из 720 запусков. Эскалации добавили ещё 73 случая, которые монитор пропустил. Из 154 отправленных отчётов 153 правильно называли существующую проблему — точность 99,4%. @anti_agi

