Трансформеры как мини-компьютеры: новая возможность LLM
Трансформеры как мини-компьютеры: новая возможность LLM Оказывается, в трансформеры можно встроить эффективный интерпретатор WebAssembly прямо в процесс обработки данных языковой модели. При этом модель остаётся авторегрессионной, но генерируемый ею текст представляет собой шаги выполнения программы. На каждом этапе модель предсказывает следующий элемент (токен), который кодирует различные аспекты вычисления: память, регистры, стек, промежуточные результаты и инструкции. Есть нюанс: в отличие от обычного компьютера, где данные могут перезаписываться, в модели предыдущие токены нельзя изменить. Новое состояние добавляется как продолжение последовательности, а не перезаписывает старое. Таким образом, трансформеры могут служить носителем строгого алгоритмического вычисления. Авторы исследования показали, что LLM способны решать сложные математические задачи, но иногда допускают ошибки в простых вычислениях. Новая методика может помочь устранить этот недостаток. В статье также описывается метод ускорения вывода (inference) с помощью 2D attention heads. Ссылки из исходного поста: https://www.percepta.ai/blog/can-llms-be-computers Материалы по ссылкам: 1. Can LLMs Be Computers? | Percepta В статье рассматривается возможность использования трансформеров для выполнения произвольных программ на языке C. Описывается метод, позволяющий ускорить вывод (inference) в экспоненциальной степени за счёт использования 2D attention heads. Авторы статьи — Christos Tzamos и другие сотрудники компании Percepta. https://www.percepta.ai/blog/can-llms-be-computers Источник: оригинальный пост