NVIDIA выкатили Nemotron 3 Embed — семейство open-моделей для RAG, agentic retrieval, c... — 17 июля 2026 г. в 10:43:16.777
NVIDIA выкатили Nemotron 3 Embed — семейство open-моделей для RAG, agentic retrieval, code retrieval и памяти агентов. Флагман Nemotron-3-Embed-8B-BF16 заявлен как SOTA на multilingual RTEB на 16 июля 2026 года. Это retrieval-бенчмарк: он показывает, насколько хорошо embedding-модель находит нужный контекст для RAG. Почему это важно для агентов? Когда retrieval промахивается, агент получает мусорный контекст. Дальше начинаются лишние поиски, длиннее reasoning, больше токенов и выше счёт за inference. В линейке три модели: * 8B-BF16 — максимум качества * 1B-BF16 — дешевле и быстрее для продакшена * 1B-NVFP4 — версия под Blackwell/vLLM, квантованная через NVIDIA Model Optimizer Все модели работают с входом до 32K токенов, то есть могут индексировать длинные документы, код и agent history без слишком агрессивной нарезки. У 1B-NVFP4 на RTEB почти тот же результат, что у BF16: 72.00 против 72.38, при этом модель остаётся совместимой по embedding-space с 1B-BF16. https://huggingface.co/blog/nvidia/nemotron-3-embed-wins-rteb

