Модели по-разному ведут себя в агенте: одна сама ставит командам лимит времени, другая ... — 4 октября 2026 г. в 06:16:15.094
Модели по-разному ведут себя в агенте: одна сама ставит командам лимит времени, другая то и дело ломает вызовы инструментов. Поэтому одна и та же обвязка одну страхует, а другую оставляет без обратной связи: команда зависла, и агент так и не узнаёт, что застрял. Новая модель в привычном агенте может сработать хуже прежней, даже если в рейтингах она выше. Это хорошо видно в препринте NTU, где пять моделей гоняли через разные агентные оболочки. В минималистичной Pi 0.84.4 у шелла нет тайм-аута по умолчанию. GPT-6 Astra ставит его сама больше чем в половине вызовов, и на Terminal-Bench 4 в Pi решила больше задач, чем в DeepSeek Harness, обойдясь в четыре с лишним раза дешевле на задачу. Kimi K3 на задаче в GIMP из другого набора, TUA-Bench, запустила скрипт без команды выхода, и за все 40 минут лимита Pi ничего ей не вернула. В openJiuwen такой же зависший вызов через пять минут вернулся ошибкой: Kimi сама поняла причину, нашла уже сохранённую картинку, проверила её и сдала задачу. Лучшее сочетание менялось и от задач: у четырёх моделей из пяти победившая оболочка менялась при смене набора задач. На трёх графиках цвет означает модель, и разброс точек одного цвета по высоте и цене показывает, сколько решает сочетание целиком. Справа внизу — разобранный случай с GIMP. Код запуска оболочек и все траектории выложены, по логам видно, где агент получил сигнал о сбое, а где остался без него. @neuro_channel