Даем агенту долгоскую память на локальном железе: Qdrant + Ollama — 4 июля 2026 г. в 09:27:05.020
Даем агенту долгоскую память на локальном железе: Qdrant + Ollama Контекстное окно модели — не хранилище. Для stateful-интеракций и RAG нужна выделенная векторная база, чтобы агент помнил инциденты, конфиги или предпочтения между сессиями. Локальный стек дает контроль над данными и независимость от API-лимитов. Связка Ollama для эмбеддингов и Qdrant как векторного бэкенда закрывает задачу без лишних зависимостей. Архитектура: входящий запрос эмбеддится той же моделью, что и документы, происходит similarity search, найденные чанки добавляются в системный промпт перед генерацией. - Модель эмбеддингов: Тянуть тяжелые модели не нужно. Nomic Embed Text (768 dim, ~200MB) дает отличный баланс качества и скорости даже на CPU. Запуск: ollama pull nomic-embed-text. - Конфиг Qdrant: Для текстовых задач используйте метрику Cosine. Размер вектора жестко завязан на модель (768). Создаем коллекцию через Python-клиент:client.create_collection(name="agent_memory", vectors_config=VectorParams(size=768, distance=Distance.COSINE)) - Чанкинг и метаданные: Не храните сырые логи. Разбивайте текст на чанки (500-1000 токенов с перекрытием 10%). Обязательно добавляйте payload: timestamp, source_file, session_id. Это критично для фильтрации запросов (where clause) перед поиском. - Гибридный поиск: Если в памяти есть структурированные данные (IP, UUID, версии), включайте фильтры по payload. Чистый векторный поиск может пропустить точное совпадение по ID ошибки или имени сервиса. #RAG #VectorDB #LocalLLM #Python #AIEngineering Какой стек памяти используешь для своих агентов? Делись ссылками на репозитории или конфигами в комменты →

