📉 RAP-RAG: как перевести GraphRAG на дешевые модели без потери точности — 4 июня 2026 г. в 06:00:12.530
📉 RAP-RAG: как перевести GraphRAG на дешевые модели без потери точности Многие RAG-системы отлично показывают себя на демо-презентациях, потому что работают на топовых коммерческих моделях. Но когда дело доходит до масштабирования в продакшене, запуск флагманской LLM на каждый поисковый запрос быстро пробивает бюджет. Очевидный шаг — заменить модель на небольшую и дешевую (SLM). Но тут точность GraphRAG лавинообразно падает: маленькие модели хуже выделяют сущности, из-за чего граф связей получается зашумленным, а извлекаемый контекст — нерелевантным. Исследование, опубликованное в журнале *MDPI Electronics*, описывает архитектуру RAP-RAG, спроектированную специально для решения этой проблемы. Она позволяет запустить графовый RAG на небольших моделях с минимальной потерей качества. Две ключевые фичи RAP-RAG: • Устойчивый к шуму граф (Heterogeneous Weighted Graph): В отличие от классического GraphRAG, который строит связи только на основе семантического сходства сущностей, RAP-RAG объединяет два сигнала: семантику и структурную связность (совместное появление в одних и тех же фрагментах текста). Даже если дешевая модель ошибается в семантике, структурные связи удерживают граф от распада. • Адаптивный планировщик запросов (Adaptive Planner): Система не использует один и тот же тяжелый алгоритм для всех задач. Простые запросы отправляются на быстрый векторный поиск, а сложные (multi-hop) — на трассировку графа. Это защищает небольшую модель от перегрузки лишней информацией, в которой она могла бы запутаться при генерации ответа. Что это дает на практике? Тесты на датасетах (LiHua-World, MultiHop-RAG) показали преимущество над GraphRAG и LightRAG по точности на 3–5%, при этом требования к дисковому хранилищу графа снизились на 15%. Главное — разрыв в качестве ответов при использовании дорогой и дешевой модели значительно сократился. Ограничения для архитекторов: 1. Архитектурная сложность возрастает. Внедрять такой подход стоит только тогда, когда экономия на стоимости запросов действительно перевешивает затраты на поддержку сложного графового конвейера. 2. Готовой библиотеки типа pip install пока нет. Публикация служит детальным архитектурным чертежом для самостоятельной реализации. 3. Это сглаживает разницу между моделями, но не стирает её полностью — существует минимальный порог возможностей модели, ниже которого граф-инженерия бессильна. Материалы: • MDPI Electronics #ИИ #RAG #GraphRAG #АрхитектураСистем #МашинноеОбучение