Почему универсальный ИИ-агент проигрывает: +21.7% к точности иерархической системы — 21 мая 2026 г. в 08:00:03.312
Почему универсальный ИИ-агент проигрывает: +21.7% к точности иерархической системы Универсальный агент с доступом ко всем инструментам — интуитивно привлекательная архитектура. Одна модель, один контекст, все данные. Но на практике это проигрышная стратегия. На сложных мультимодальных запросах flat-агент показывает 62.8% точности против 84.5% у иерархической системы со специализированными воркерами. Разница — не в модели (она остается прежней), а в декомпозиции. Protocol-H: supervisor-worker для агентного RAG Статья на InfoQ описывает архитектуру Protocol-H — реализацию паттерна supervisor-worker для агентного RAG. Суть подхода в том, что супервизор не выполняет запросы сам, а разбивает сложный вопрос на атомарные задачи и маршрутизирует их к специализированным агентам: ➡ SQL-воркер — структурированные данные (базы, таблицы) ➡ Векторный воркер — семантический поиск по документам Почему специализация работает лучше Вопрос не философский, а инженерный: ▪️ SQL-воркер знает схему базы данных, валидирует запросы до выполнения, учитывает диалект конкретного хранилища (Snowflake, Redshift, BigQuery). ▪️ Векторный воркер комбинирует BM25 и плотный поиск, фильтрует по релевантности. Каждый агент оптимизирован под свою модальность — вместо того чтобы заставлять одну модель одновременно думать про JOIN-синтаксис и косинусную близость. Reflective retry: автономное восстановление после ошибок Отдельного внимания заслуживает обработка ошибок. Анализ провальных ответов показал: примерно 60% галлюцинаций порождены не ошибками рассуждений модели, а необработанными сбоями выполнения (неудачный SQL, пустой результат поиска, несовпадение схемы). Protocol-H реализует механизм reflective retry: 1️⃣ При ошибке система анализирует причину; 2️⃣ Корректирует запрос; 3️⃣ Повторяет попытку до того, как ошибка превратится в уверенно сформулированный неверный ответ. Итоговый уровень галлюцинаций — 7.1% против 28.5% у стандартного RAG. Детерминированный control flow для enterprise Архитектура предусматривает детерминированный control flow через StateGraph: порядок обхода узлов, переходы состояний и логика ретраев воспроизводимы при одинаковых входных данных. Для enterprise-среды это критично — аудит и комплаенс требуют не только правильного ответа, но и прозрачной цепочки решений, которая к нему привела. Ограничения ▪️ Латентность (p95) 2.1 сек (против 0.8 сек у стандартного RAG). ▪️ Бенчмарк EntQA разработан авторами, не публичный стандарт. ▪️ GPT-4o оценивает GPT-4o → риск circularity bias. Ключевой вывод Качество декомпозиции задач становится определяющим фактором в агентных системах. Не размер контекстного окна, не количество доступных инструментов, не мощность базовой модели — а то, насколько точно сложный запрос разбит на специализированные подзадачи и как организована оркестрация между ними. #tech_inside

