И ещё немного про железо и куда ветер дует. Сегодня у меня какое-то настроение про абст... — 25 июня 2026 г. в 16:02:30.558
И ещё немного про железо и куда ветер дует. Сегодня у меня какое-то настроение про абстрактное поговорить, а не новые модели обозревать. Так вот. Сейчас языковую модель гоняют на универсальной видеокарте, где веса постоянно курсируют между памятью и вычислительными ядрами. Эта пересылка и есть главный тормоз. Канадский стартап Taalas зашёл иначе и впечатал Llama 3.1 8B прямо в кремний: веса запекли в транзисторы чипа, и память-посредник больше не нужна. На выходе около 17 тысяч токенов в секунду на пользователя, это в десятки раз быстрее топовой видеокарты на той же модели, плюс дешевле и экономичнее по энергии. Расплата за скорость: такой чип навсегда заточен под одну модель, обновить веса нельзя, и контекст у неё маленький. Но направление понятное: по мере того как архитектуры устаканиваются, инференс уходит с гибких GPU на специализированное железо. Свой инференс-чип на пару с Broadcom готовит и OpenAI. Куда расти пространство есть, сейчас перерасход энергии на современные модели колоссальный, поворот в сторону эффективности очень уж просится. @neuro_channel

