Стартап живет три года или по граблям ASIC'ов — 1 июля 2026 г. в 15:40:08.921
Стартап живет три года или по граблям ASIC'ов Коротко о том, почему не надо "запекать" архитектуры в кремнии Стартап Etched, который разрабатывает чип для инференса LLM, отчитался о прогрессе. TSMC впервые отпечатала в кремнии их чип Sohu, а компания уже заявляет около $1 млрд законтрактованных заказов на готовые системы под него. Оговорка сразу: чип пока тестируется, а не работает в проде. То есть миллиард этот пока только на бумаге. Но интересно не это. Кремний только стал реальностью, а архитектурно чип уже опоздал. Чтобы увидеть подвох, надо понять, чем Sohu отличается от старых-добрых GPU. GPU универсален: под него компилируется что угодно. Etched пошел наоборот и зашил саму архитектуру трансформера прямо в чип. Жесткие схемы, никакого программируемого слоя. Под эту одну задачу чип выходит кратно быстрее и дешевле. И вот тут ловушка, которую многие могли наблюдать во время бума майнинга. ASIC умеет ровно то, подо что разведен, и ничего сверх. Значит, чип с зашитой логикой по определению догоняет софт. А софт, как мы знаем, уже убежал вперёд. Трансформер жив, механизм внимания никуда не делся, тут Etched прав. Промах на уровень ниже. Внутри самого семейства трансформеров фронтир разделился на две ветки: плотные модели и MoE. А Sohu умеет работать только с плотными. Разница ровно в одном слое. В плотной модели каждый токен идет через один и тот же блок вычислений, путь фиксированный, в жесткую схему ложится идеально. В MoE вместо одного блока набор экспертов и маршрутизатор, который на каждом токене на лету решает, кого включить. Ветвление по данным, нерегулярный доступ к памяти. Угадайте, а какая архитектура у самых скачиваемых на обнимающем лице моделей? И DeepSeek V4, и Qwen3, и свежий GLM 5.2, построены как MoE и на Sohu не запускаются. И это не разовое невезение, а свойство подхода: под каждую новую ветвь архитектуры нужен новый чип. А разрабатывать его, по словам компании, три года. Дело не в том, что чип специализированный, а в том, что он жестко разведен. У Google есть свой ИИ-чип TPU, тоже собственной разработки и тоже формально ASIC. Но программируемый: MoE для него штатная нагрузка, он и обучает модели, и обслуживает их, а новая архитектура для него это перекомпиляция, а не новый кремний. И под всем этим ни одного независимого замера. Заявленные 500 000 токенов в секунду кочуют по анонсам Etched с 2024 года без единой внешней проверки. Рынок инференса плотных трансформеров реальный и немаленький, так что кирпичом Sohu не станет, заказчики найдутся. Но потолок теперь виден: архитектура, под которую его лили, уже другая. @anti_agi

