Как собрать локального RAG-агента с долгой памятью и Tool Use без облаков — 5 июля 2026 г. в 12:57:36.529
Как собрать локального RAG-агента с долгой памятью и Tool Use без облаков Облачные API дешевеют, но корпоративные контуры, compliance и контроль над данными требуют полностью оффлайнного стека. Многие забивают голову на LangChain-шаблонизаторах, теряя производительность из-за лишнего оверхеда и скрытых зависимостей. На практике достаточно связки Ollama + Qdrant + кастомный event-loop на asyncio. Разберем рабочую схему, которая обрабатывает запросы за <2 сек, хранит контекст сессий и падбэктит на локальную базу знаний без галлюцинаций. Подходит для внутреннего Helpdesk, DevOps-ассистентов или автоматизации парсинга логов. Основной принцип — строгое разделение responsibilities: инференс, векторный поиск и state-менеджмент живут в изолированных сервисах. Ollama держит модель (рекомендую Qwen3 или Mistral-Nemo для баланса контекста/скорости), Qdrant хранит эмбеддинги и мета-теги документов, а оркестратор управляет маршрутизацией запросов. Ключевая боль таких систем — потеря контекста при длинных диалогах и деградация качества поиска при плохом chunking. Решается через гибридный индекс (vector + sparse) и явное управление window-буфером истории. Ниже готовый blueprint для продакшена: #AI #LLM #OpenSource #RAG

