# 📚 Codex, AI-агенты для кодинга — подборка arxiv.org — 2 августа 2026 г. в 04:57:58.669
# 📚 Codex, AI-агенты для кодинга — подборка arxiv.org **15 статей**, все ссылки проверены (HTTP 200). --- ## 🥇 Классика — must-read **1️⃣ Evaluating Large Language Models Trained on Code** ▪️ Mark Chen, Jerry Tworek, Heewoo Jun • 2021-07-07 ▪️ 🔹 https://arxiv.org/abs/2107.03374 ▪️ Оригинальная статья про **Codex** от OpenAI — фундамент GitHub Copilot. Вводят бенчмарк **HumanEval** (164 задачи на Python по docstring). Codex решает 28.8%, GPT-3 — 0%. **2️⃣ SWE-bench: Can Language Models Resolve Real-World GitHub Issues?** ▪️ Carlos E. Jimenez, John Yang, Alexander Wettig • 2023-10-10 ▪️ 🔹 https://arxiv.org/abs/2310.06770 ▪️ Золотой стандарт оценки coding-агентов: 2294 реальных issue из 12 Python-репозиториев. GPT-4 на момент выхода — 1.97%. По этому бенчу меряют Devin, SWE-Agent, AutoCodeRover. **3️⃣ ReAct: Synergizing Reasoning and Acting in Language Models** ▪️ Shunyu Yao, Jeffrey Zhao, Dian Yu • 2022-10-06 ▪️ 🔹 https://arxiv.org/abs/2210.03629 ▪️ Паттерн «Reason + Act» — LLM чередует мысли и вызовы инструментов. Лежит в основе большинства современных coding-агентов. --- ## 🛠️ Tool use и архитектура агентов **4️⃣ Toolformer: Language Models Can Teach Themselves to Use Tools** ▪️ Timo Schick, Jane Dwivedi-Yu, Roberto Dessì • 2023-02-09 ▪️ 🔹 https://arxiv.org/abs/2302.04761 ▪️ Meta-research: модель сама учится вызывать API (калькулятор, поиск, календарь). Фундамент для дизайна tool-augmented агентов. **5️⃣ Voyager: An Open-Ended Embodied Agent with Large Language Models** ▪️ Guanzhi Wang, Yuqi Xie, Yunfan Jiang • 2023-05-25 ▪️ 🔹 https://arxiv.org/abs/2305.16291 ▪️ Агент в Minecraft, который сам пишет себе код новых навыков и копит библиотеку. Вдохновение для рефакторинг-агентов с долгосрочной памятью. **6️⃣ AutoCodeRover: Autonomous Program Improvement** ▪️ Yuntong Zhang, Haifeng Ruan, Zhiyu Fan, Abhik Roychoudhury • 2024-04-08 ▪️ 🔹 https://arxiv.org/abs/2404.05427 ▪️ Автономный bug-fix и рефакторинг-агент на SWE-bench. Использует code-search + AST-анализ. Показывает: простой агентный цикл + хорошие tools бьёт «больше токенов». --- ## 🏗️ Frameworks для построения приложений **7️⃣ HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face** ▪️ Yongliang Shen, Kaitao Song, Xu Tan • 2023-03-30 ▪️ 🔹 https://arxiv.org/abs/2303.17580 ▪️ Контроллер-LLM планирует задачи и делегирует их специализированным моделям из HuggingFace. Прямой пращур Devin и multi-model агентов. **8️⃣ MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework** ▪️ Sirui Hong, Mingchen Zhuge, Jiaqi Chen • 2023-08-01 ▪️ 🔹 https://arxiv.org/abs/2308.00352 ▪️ Software-компания из LLM-агентов: ProductManager, Architect, Engineer, QA. Standard Operating Procedures кодифицируют workflow. HumanEval — 85.9% pass@1. **9️⃣ AgentBench: Evaluating LLMs as Agents** ▪️ Xiao Liu, Hao Yu, Hanchen Zhang • 2023-08-07 ▪️ 🔹 https://arxiv.org/abs/2308.03688 ▪️ Восемь сред для оценки LLM-агентов, включая code-as-action. GPT-4 лучший — но всего 56% в лучшем домене. Помогает выбирать модели под agentic pipeline. --- ## 👨💻 UX агентов и IDE-интеграции **🔟 The Impact of AI on Developer Productivity: Evidence from GitHub Copilot** ▪️ Sida Peng, Eirini Kalliamvakou, Peter Cihon • 2023-02-13 ▪️ 🔹 https://arxiv.org/abs/2302.06590 ▪️ RCT 2023: с Copilot задачи решаются **на 55.8% быстрее** контрольной группы. Новички выиграли больше всех. Доказательство UX-ценности code-completion агентов. **1️⃣1️⃣ Tool-Augmented LLMs as a Universal Interface for IDEs** ▪️ Yaroslav Zharov, Yury Khudyakov, Evgeniia Fedotova • 2024-02-18 ▪️ 🔹 https://arxiv.org/abs/2402.11635 ▪️ IDE как набор «спрятанных» инструментов (компиляция, отладка, поиск) под LLM-интерфейсом на естественном языке. Design-pattern для IDE-плагинов. **1️⃣2️⃣ Will Code Remain a Relevant User Interface for End-User Programming with Generative AI Models?** ▪️ Advait Sarkar • 2023-11-01 ▪️ 🔹 https://arxiv.org/abs/2311.00382

