Для понимания, в одной современной облачной коммерческой модели примерно от 4 до 10 трл...
Для понимания, в одной современной облачной коммерческой модели примерно от 4 до 10 трлн. параметров, в опусе или астре до 5 трлн, плюс контекст, я уверен Для работы 1 млрд параметров (без контекста) нужен 1 гб видеопамяти быстрой Например, llm локальная qwen-3.8-27B (27 млрд), самая популярная сейчас модель для дома, при квантовании Q4 + 200к контекста ей требуется одна rtx 3090 с 24 ГБ, но это версия по сути в 8 раз ухудшенная по сравнению с оригинальной qwen 3.8 27B, где 1 млрд = 1 гб Если кому интересно, что Алиса что Сбер именно на Qwen работают, только конечно там не 27B а 500B и выше модели Так вот, опус при его, допустим, 5000B требует 5 ТБ видеопамяти плюс ещё столько же под контекст С увеличением размера модели ухудшается скорость работы потому что модель делить приходится на видеокарты, видели китайское шоссе, где огромная дорога в узенькую превращается и пробки, это если не специализированные карты использовать то так получается, они большую часть времени простаивают и ждут своей очереди просчета весов, из-за чего скорость работы падает очень существенно Нужны специализированные видеокарты, с мощными процессорами и nvlink (прямая связь почти без потерь, этим интерфейсом подключенные работают практически как одно устройство), современная такая видеокарта Nvidia H200 на 141 GB стоит 5+ млн каждая, плюс под них серверы, там одна стойка такая под полмиллиарда выходит, в ДЦ не колхозят Да, сейчас модели начали разбивать на специалистов, чтобы если вопрос по медицине не грузить программиста или юриста, и такие проще умещать в видеопамять, но всё равно это всё должно быть рядом, модель не может предугадать первый вопрос пользователя, с которого диалог начнется, и быть запущенной не целиком Вот и куда она сбежит, эта модель? Получился краткий мануал по нейросетям, кто ничего не понимал теперь понимает хоть немного.