Маленькая модель против большой самоуверенности — 3 июня 2026 г. в 16:11:02.848
Маленькая модель против большой самоуверенности AIRI при поддержке Сбера представила OCC-RAG — первую компактную модель из семейства Optimal Cognitive Core. Это попытка сделать ИИ не энциклопедией на максималках, а «когнитивным ядром» для работы с внешними источниками: документами, базами данных, поиском и корпоративными системами. OCC-RAG вышла в двух размерах: на 0.6B и 1.7B параметров. Обе версии не обучали с нуля, а адаптировали под нужный вид рассуждений через mid-training поверх Qwen3-0.6B-Base и Qwen3-1.7B-Base. Ключевая идея — заставить модель отвечать только по предоставленным документам. По результатам тестов версия на 1.7B параметров особенно хорошо смотрится на задачах, где проверяют верность контексту и умение не уходить в знания из весов 👆 ▪️ На ConFiQA, бенчмарке на верность предоставленному контексту, OCC-RAG-1.7B набрала 81.4. Это выше Qwen3-8B в thinking mode — 77.6, Qwen3-14B — 78.3, Qwen3-32B — 75.8 и Gemma3-27B — 73.0. ▪️ По Memorization Ratio у OCC-RAG-1.7B результат 5.0. Это метрика, которая показывает, насколько часто модель вместо контекста опирается на знания из собственных весов. Чем ниже показатель, тем лучше. У Qwen3-1.7B в thinking mode — 8.3, у Qwen3-32B — 8.5, у Pleias-RAG-1.2B — 25.3. ▪️ На MuSiQue-Un, где проверяют корректный отказ при нехватке данных, OCC-RAG-1.7B получила 87.2%. OCC-RAG-0.6B — 86.9%. Для сравнения, у Qwen3-4B в thinking mode — 84%, у Qwen3-8B — 90.3%, у Pleias-RAG-1.2B — 21.9%. Компактный размер даёт и прикладную экономику. OCC-RAG, по данным AIRI, обрабатывает запросы в 1.5-2 раза быстрее обычных LLM, в среднем тратит в 1.5 раза меньше токенов на генерацию ответа, а разница в цене за токен составляет от 1.4 до 4.3 раза. Следующий шаг в AIRI описывают как переход от контекстного Q&A к агентному ядру. Модель хотят научить самостоятельно искать недостающий контекст: обращаться к поиску, базам данных, корпоративным сервисам, кодовым репозиториям и при необходимости вызывать другие ИИ-модели. В корпоративном ИИ это может оказаться более практичным направлением, чем бесконечное наращивание параметров ради универсальности. Модель уже доступна под лицензией MIT на Hugging Face, GitHub и GitVerse. @anti_agi

