⚙ Большая языковая модель = большой кластер из десятков GPU? — 21 июля 2026 г. в 13:52:07.699
⚙ Большая языковая модель = большой кластер из десятков GPU? Не всегда. Для обучения foundation‑моделей или публичных сервисов с миллионами пользователей это действительно так. Но внутри SOC нагрузка устроена иначе. Здесь LLM не работает как универсальный чат. Она получает уже собранный в SOAR контекст и решает конкретные задачи: объясняет срабатывания правил корреляции, выделяет ключевые артефакты, ищет похожие инциденты и помогает сформировать предварительный вердикт. Мы решили проверить, какие ресурсы действительно нужны для такого сценария. Для этого развернули self‑hosted‑стенд с Qwen3.5‑122B‑A10B‑GPTQ, vLLM и одной RTX PRO 6000 Blackwell Max‑Q с 96 ГБ видеопамяти, а затем протестировали его на анонимизированных данных реальных SOC-инцидентов. В первой части исследования разбираем: 🔹 как архитектура современных LLM влияет на требования к инфраструктуре; 🔹 из чего складывается потребление видеопамяти; 🔹 как рассчитывается конкурентность запросов; 🔹 насколько теоретические оценки совпадают с результатами реальных стресс-тестов. ➡ Если интересно, сколько запросов способна обработать одна GPU и какие ресурсы действительно нужны для запуска LLM внутри SOC, — читайте первую часть исследования на Хабре. Материал будет полезен ML‑инженерам, работающим с LLM, а также CISO и специалистам SOC, которые рассматривают применение генеративного ИИ в задачах кибербезопасности.

