Как собрать надёжный рабочий стек из LLM‑агентов: мой опыт, «плюсом» и «минусом»
Как собрать надёжный рабочий стек из LLM‑агентов: мой опыт, «плюсом» и «минусом» У меня уже работает система из четырёх «уровней» – два LLM‑агента (Pi/Crush и Hermes), локальная модель Qwen3.6 и отдельный профиль для проверок (OSS‑120). Чтобы всё это стало действительно продуктивным, я ввёл оркестратор задач, вынес память проекта из‑под агента, создал профиль валидации,—а также отдельный «автоматический» профиль и набор «policy‑tools». Ниже — детальное разборка того, как я пришёл к такому решению и какие практические шаги помогут вам построить аналогичную инфраструктуру без лишних «заигрываний». Агент‑кода 🧑💻 Pi / Crush – два одинаковых по скорости и возможностям агента (одинаковое железо и модели). Pi – «голый», без лишних надстроек. Crush – к «голому» добавлены MSP и прочие удобства. Агент‑мультизадач Hermes 📦 Имеет три профиля: - coding. Пишет код, рефакторит, пишет тесты и документацию. - seo. Собиратель навыков для SEO‑задач. - general. Всё, что не вписывается в первые два, чтобы они не «засорялись». 🔄 Если какую‑то операцию делаю > 3 раз – формирую отдельный навык. Локальная модель Qwen3.6 🧠 Q6 по тестам оказалось самым сбалансированным вариантом. Для проверок использую oss120 / qwen3-coder-next / qwen3-next-80b. Знаешь, что тут главное? Не заиграться... Вот список важных нюансов 1. С одно стороны нужен 4й слой - оркестратор задач. Не ещё один агент, а слой, который решает, куда отправить задачу: coding / seo / general / проверка. Это может быть простой роутер по правилам, чтобы не думать каждый раз вручную. А с другой... проще запускать то что руками нужно когда нужно. 2. Обязательно память проекта хранить отдельно от памяти агента. Для каждого проекта необходимо держать краткий state: цели, стек, ограничения, решения, TODO, “что уже пробовали”. Тогда агент не будет заново изобретать велосипед. 3. Отдельный профиль, который не пишет, а только проверяет: баги, риски, архитектуру, качество промпта, SEO-ошибки. Сомневаюсь, что нужен постоянно... периодически руками запускаю что то. похожее. 4. Профиль для рутинной автоматизации. Для задач типа парсинга, отчётов, генерации файлов, обновления контента, выгрузок, триггеров. Он сильно разгружает coding-агента. Тут сложнее так как часть этих самых рутинных операций находится вне агента =) в других больших комплекстных моих системах в виде готовых пайплайнов (скриптов). 5. Обязательны “policy tools”. Мини-навигация по правилам: что можно делать без подтверждения, что только после подтверждения, что всегда через тесты/диффы/черновики. Это очень помогает, избежать хаоса. Пока так