Локальный RAG для корпоративной базы знаний: Ollama + Qdrant за 15 минут — 4 июля 2026 г. в 06:32:37.022
Локальный RAG для корпоративной базы знаний: Ollama + Qdrant за 15 минут Облачные API дороги и рискованны для NDA-документов. Разворачиваем локальный стек для поиска по архивам логов, Confluence или внутренним гайдам на Debian/Ubuntu. Архитектура проста: векторная БД хранит эмбеддинги, LLM генерирует ответы на основе контекста. Никаких данных не покидает сеть, контроль версий и моделей — полный. Это решение снижает задержку (latency) при поиске по внутренним ресурсам и полностью изолирует инфраструктуру от внешних утечек. Идеально для техподдержки или DevOps-команды, которой нужно быстро гуглить по репозиториям без доступа к внешнему интернету. - Стек: Ollama (инференс) + Qdrant (векторы) + Python/LangChain. Модель: Llama 3 8B Instruct для баланса скорости/качества на 1x24GB GPU. - Эмбеддинги: Используем nomic-embed-text. Быстрее и точнее для технических текстов, чем старые BGE. Запуск: ollama pull nomic-embed-text. - Docker Compose: Поднимаем Qdrant на порту 6333. В конфиге qdrant.yaml указываем storage: { on_disk_pages: true } для экономии RAM при больших коллекциях логов. - Поиск: Скрипт разбивает markdown-доки на чанки (512 tokens, overlap 50), вычисляет векторы через Ollama API и пушит в Qdrant. Запрос идет с hybrid search (keyword + vector) для точного попадания по именам файлов/функций. #RAG #LocalLLM #DevOps #VectorDB #OpenSource Твой опыт? Делюсь конфигами / напиши что используешь для этой задачи →

