RAG | Нейросети | ИИ | AI | Агенты | Mistral Large 4 | Gemini 4 Argon | GPT-6.1 Sol | Claude Sonnet 5.5 | GLM 5.3 | DeepSeek V4.1
IT и технологии · 9 августа 2026 г.
SWE-bench стабильно завышает способности кодинг-агентов — Claude Code падает с 78% на б...
SWE-bench стабильно завышает способности кодинг-агентов — Claude Code падает с 78% на бенчмарке до 48% принятых PR, Cursor Agent с 67% до 42%, Devin с 58% до 38%. Разрыв 20–30 пунктов у всех троих. Проблема не в сложности задач. Бенчмарк не проверяет, впишется ли код в conventions проекта и пройдёт ли человеческое ревью. А это главное, что решает судьбу PR. Presenc AI, май 2026