RAG на локалке: как не слить контекст и ускорить поиск — 4 июля 2026 г. в 05:38:07.859
RAG на локалке: как не слить контекст и ускорить поиск Локальные RAG-системы часто упираются в два узких места: медленный поиск по векторам и переполнение контекста LLM мусором. Проблема редко кроется в самой модели генерации, чаще — в стратегии препроцессинга. Стандартная нарезка текста фиксированными чанками разрушает семантику, а тяжелые embedding-модели грузят CPU даже на сервере с 4090. Для стабильного продакшена нужна грамотная настройка сплиттеров и гибридного поиска, чтобы отдавать в контекст только релевантные факты без «галлюцинаций» от лишнего шума. - Chunking 2.0: Забудьте про chunk_size=500. Используйте RecursiveCharacterTextSplitter из LangChain с separators=["\n\n", "\n", " ", ""]. Это сохраняет структуру абзацев и предложений, не рвав мысли посередине. - Эмбеддинги: Не берите тяжеловесы. nomic-embed-text в Ollama дает топ-результаты при минимальном потреблении RAM (около 400 МБ). Для поиска по коду переключайтесь на codeberta. - Гибридный поиск: В Qdrant включите BM25 alongside vector search. Это спасает, когда пользователь ищет точные термины или ID, которые векторная модель может «размыть» семантически. - Кэширование эмбеддингов: Не пересчитывайте векторы при каждом запросе. Храните их в базе, обновляйте индексы только при изменении источника данных (CDC-паттерн). #RAG #LocalLLM #Qdrant #AIEngineering #DevOps Какой сплиттер используете для документации? Делитесь конфигами в комментах →

