Как дать локальному агенту долгосрочную память без утечки контекста и галлюцинаций — 5 июля 2026 г. в 07:50:15.031
Как дать локальному агенту долгосрочную память без утечки контекста и галлюцинаций Стандартные LLM-коллы stateless по определению. В продакшене это ломает многошаговые пайплайны: агент забывает параметры предыдущих шагов, дублирует запросы к API и теряет нить рассуждений при смене контекста. Простое засовывание истории в prompt быстро упирается в context window, а наивный RAG возвращает нерелевантные чанки, так как не различает факты от временных состояний системы. Решение — гибридная архитектура памяти, разделяющая эпизодическую историю, семантическую базу знаний и рабочее состояние (scratchpad). В локальном стеке это реализуется комбинацией векторного хранилища, специализированного retriever-агента и строго типизированных state-моделей. Ниже — рабочие паттерны для внедрения в DevOps-автоматизацию без зависимости от облачных API. Архитектура строится вокруг трёх слоёв: быстрый доступ к недавним действиям (circular buffer + JSON), семантический поиск по доменным данным и фильтрация шума через lightweight model для reranking. Вместо слива всего в один векторный индекс мы изолируем user profile, system logs и task context. Это критично для агентов с инфраструктурой: запрос на рестарт сервиса не должен подтягивать старые тикеты или конфиги 2019 года. В продакшене паттерн выглядит так: входящий промпт проходит через state-router, который решает, читать ли эпизодическую историю, делать семантический поиск или запрашивать fresh данные через tool. Retriever возвращает топ-N чанков, которые сразу проходят через cross-encoder для verification перед подачей в main model. Это снижает rate of hallucination и экономит токены на inference. #AI #LLM #OpenSource #RAG

