12 млн токенов без квадрата — 19 июня 2026 г. в 16:35:39.923
12 млн токенов без квадрата Стартап Subquadratic представил SubQ-1.1-Small — языковую модель с контекстом до 12 млн токенов и новым механизмом Subquadratic Sparse Attention, обещающим обеспечить максимально дешёвую работу большого контекста. У обычного attention объём вычислений растёт примерно квадратично: каждый токен приходится сопоставлять со всеми остальными. FlashAttention ускоряет эти операции и сокращает расход памяти, но не меняет саму квадратичную сложность. Есть и другой путь — архитектуры вроде Mamba. Они читают последовательность по порядку и сжимают прошлое во внутреннее состояние фиксированного размера. Это дешевле, но модели сложнее напрямую обратиться к конкретному далёкому фрагменту текста. SubQ пытается сохранить сильную сторону обычного attention: возможность точечно заглянуть в любую часть контекста. Но вместо полного перебора модель сначала выбирает небольшой набор потенциально важных токенов и работает только с ними. Разработчики утверждают, что даже этот поиск выполняется за линейное время. На контексте в 1 млн токенов такой механизм требует в 64,5 раза меньше вычислений, чем полное attention, и работает в 56 раз быстрее FlashAttention-2. В тесте на поиск информации модель сохранила точность 98% при 12 млн токенов, используя лишь 0,13% возможных связей. Похожую идею развивают и другие sparse-модели: они не пытаются просчитать все связи внутри контекста, а учатся выбирать только нужные. Главное обещание SubQ в том, что этот отбор якобы тоже не возвращает систему к квадратичной стоимости. Потенциально это полезно для анализа целых кодовых баз, больших наборов документов и длинных историй действий ИИ-агентов. Вместо постоянного разбиения данных на чанки модель сможет держать проект целиком в рабочем контексте. Проверить пока нельзя. Компания не раскрыла алгоритм отбора токенов, исходную модель, код и веса. А результат на 12 млн получен на синтетическом поисковом тесте из 50 примеров. Ну, будем посмотреть. @anti_agi

