На GMIF 2026 память снова поставили в центр AI-инференса
На GMIF 2026 память снова поставили в центр AI-инференса На конференции GMIF 2026 в Шэньчжэне Memory Wall описали как разрыв между ростом вычислений и пропускной способностью памяти. Для AI-инфраструктуры это важно: вопрос уже не сводится к ускорению GPU, а упирается в то, как держать веса модели и KV Cache ближе к вычислениям без постоянной нагрузки на DRAM и HBM. Общая логика докладов сводилась к Memory Offloading: данные предлагают вытеснять вниз по иерархии хранения вплоть до SSD. На этой рамке и строились предложения Samsung, Цай Имао и другие подходы: Z-NAND как промежуточное звено между DRAM и SSD, CXL 3.1/PCIe 6.0 CMM-D, GDDR7 и High Bandwidth Flash как новый класс памяти между HBM и SSD. Для HBF в докладе назывались до 512 ГБ и пропускная способность от 0,4 до 3,0 ТБ/с. Практический смысл в том, что архитекторы могут сравнивать не только скорость, но и стоимость размещения данных. При этом универсального решения нет: часть идей остается концептуальной, а цифры и сроки опираются на заявления и прогнозы спикеров. Для планирования инференса это хороший ориентир, но перед закупкой или перестройкой архитектуры такие подходы стоит отдельно проверять по зрелости и доступности. Источник: Habr Computer Hardware RU — https://habr.com/ru/articles/1087860/