NVIDIA радикально ускорила работу нейросетей: встречайте Nemotron-Labs Diffusion — 24 мая 2026 г. в 19:09:35.557
NVIDIA радикально ускорила работу нейросетей: встречайте Nemotron-Labs Diffusion NVIDIA выпустила новую серию открытых языковых моделей под общим названием Nemotron-Labs Diffusion. Главное достижение инженеров — это прирост скорости в 4 раза при генерации текста без малейшей потери качества. Модели способны выдавать до 865 токенов в секунду на флагманском GPU B200. Как это работает? Обычно нейросети генерируют текст «слово за словом», что очень сильно нагружает видеокарту. NVIDIA придумала хитрый ход — самоспекуляцию. Модель буквально учится делать предсказания «пачками»: сначала набрасывает черновик из нескольких слов в специальном режиме, а потом сама же его проверяет. Это происходит так быстро и эффективно, что GPU перестает «простаивать» в ожидании новых данных. Почему это важно? 1. Результат не меняется: Если вы дадите модели одинаковый запрос, она выдаст тот же самый ответ, что и раньше, просто сделает это в несколько раз быстрее. 2. Эффективность: В тестах на программирование и математику новые модели NVIDIA обходят текущих лидеров индустрии (например, Qwen3 с технологией Eagle3) в несколько раз. 3. Перспективы: Технология теоретически может быть внедрена в любые современные модели (например, Llama или DeepSeek), если их разработчики решат дообучить свои продукты под новый алгоритм. Закрытым гигантам вроде OpenAI или Google придется интегрировать это самостоятельно, если они захотят добиться аналогичного ускорения.

