Подборка из 6 свежих статей по LLM, агентам и AI-инфраструктуре. — 3 сентября 2026 г. в 12:13:43.018
Подборка из 6 свежих статей по LLM, агентам и AI-инфраструктуре. 1. Learning to Use Tools RL для математического и строгого рассуждения 🗂️ Интеграция внешних инструментов в LLM критична там, где нужны строгие вычисления и проверяемость фактов. Авторы используют Reinforcement Learning, чтобы агент не гадал, а вовремя вызывал нужный тул. 📌В бою: расширение MCP-протоколов и наборов инструментов у воркеров; декомпозиция сложных запросов в планировщике задач; RAG-контекст между сессиями клиентов. Ссылка 2. LLM-Based Agents for Systems Security безопасность и аудит 🗂️ Секьюрити-пайплайны сугубо процедурны: сбор разнородных артефактов, выдвижение гипотез, вызов утилит, анализ вывода и смена плана. Статья структурирует агентные подходы к сложным системам. 📌В бою: защита Telegram-ботов от prompt-injection и абуза; прокачка роутинга в диспетчере (выбор воркера под тип задачи); паттерны автономных ревизий плана. Ссылка 3. ContextPilot проактивное управление контекстом через 🗂️ В длинных многошаговых сценариях бесконечное раздувание контекста убивает точность и бюджет. ContextPilot учит агента динамически сохранять, сжимать и отбрасывать лишнюю историю без потери фокуса. 📌В бою: бесконечные диалоги в outreach и лидген-сервисах; долгосрочная память клиента без деградации модели; надежный long-horizon код-генератор. Ссылка 4. Program Learning with Verifiable Rewards символьный backprop для post-training 🗂️ Дообучение reasoning-способностей модели через проверяемые награды (verifiable rewards) вместо размытого RLHF на предпочтениях людей. Символический подход гарантирует корректность шагов. 📌В бою: тюнинг моделей под жесткие доменные ниши (юриспруденция, аудит); кодогенераторы для парсеров и автоскриптов; валидация метрик качества агентов. Ссылка 5. PersonaForge реалистичная симуляция пользователей для стресс-тестов 🗂️ Большинство бенчмарков тестируют агентов на идеальных, полных запросах. PersonaForge генерирует неидеальных, капризных и многошаговых «пользователей» для реалистичной проверки пайплайнов. 📌В бою: бенчмаркинг диалоговых воронок и воркеров; подготовка синтетических multi-turn датасетов под post-training; шлифовка MCP-интеграций в стресс-условиях. Ссылка 6. NL2AGBench бенчмарк автоформализации естественного языка 🗂️ Исследование точности трансляции естественного языка в строгие формальные структуры (на примере AlphaGeometry). Фундамент для превращения хаотичного пользовательского ввода в машинный код. 📌В бою: преобразование свободного текста в структурированные вызовы API; точная декомпозиция целей в планировщике задач. Ссылка 📊Архитектурный фокус явно смещается от слепого наращивания параметров к гигиеничному менеджменту контекста, RL на проверяемых наградах и стандартизации вызова инструментов.

