DeepSWE — новый бенчмарк для кодинг-агентов от Datacurve. — 29 мая 2026 г. в 11:51:02.063
DeepSWE — новый бенчмарк для кодинг-агентов от Datacurve. Команда собрала 113 задач с нуля из 91 активного open-source-репозитория на 5 языках. Условия задач не копировали из существующих PR и коммитов, чтобы модели не могли подсмотреть решения в обучающих данных. Что внутри: — промпты примерно в два раза короче, чем у SWE-bench Pro, но патчи в среднем в 5,5 раза длиннее; — верификаторы программные, оценивают функциональное поведение реализации; — строка лидерборда — это связка модель + agent harness + reasoning-effort, поэтому одну и ту же модель можно увидеть несколько раз с разными настройками. Текущий топ на картинке. Если быстро хотели понять какие модели сейчас актуально для кодинга, то вот пожалуйста, что-то более-менее адекватное для сравнения.

