NVIDIA Groq 3 LPX: ускоритель для интерактивного инференса и агентных сценариев
NVIDIA Groq 3 LPX: ускоритель для интерактивного инференса и агентных сценариев NVIDIA Groq 3 LPX объявлен как полностью перешедший в массовое производство ускоритель инференса ИИ, ориентированный на интерактивные сценарии и повышение отзывчивости платформы NVIDIA Vera Rubin. В материале его связывают с задачами, где важны низкая задержка, высокая интерактивность и быстрая генерация токенов для одного пользователя. В качестве ориентира приводится результат в тесте Artificial Analysis: на модели Gemma 4 31B при контексте 100 тысяч токенов заявлены 3400 токенов в секунду. Также говорится, что в сценариях с высокой чувствительностью к задержке устройство может опережать ближайшую альтернативную платформу до 4 раз, а для агентных задач вроде программирования — сокращать время с часов до минут. Отдельно отмечено, что Nebius планирует внедрить Groq 3 LPX в Nebius Token Factory. Для команд, строящих AI-платформы и агентные сервисы, практический смысл здесь в одном: стоит смотреть не только на пиковую мощность, но и на задержку, интерактивность и поведение под длинным контекстом. При этом выводы о превосходстве пока опираются на заявленные результаты без независимой проверки в самом материале, так что для сравнения с собственной инфраструктурой нужны дополнительные замеры.