Визуализация мозга ии. — 8 августа 2026 г. в 19:51:18.918
Визуализация мозга ии. Формирование синапсисов в искусственном интелекте (эмбендинг). Базовая формула вычислений: Стохастическая динамика и детерминированная селекция в процессе авторегрессионной генерации дискретных последовательностей нейронными сетями Пусть $V$ — конечное множество токенов (словарь), $|V| = N$. Пусть $\mathbf{x} = (x_1, x_2, \dots, x_{t-1})$ — сгенерированная на предыдущем шаге последовательность длины $t-1$, где каждый элемент $x_i \in V$. Вычисление следующего элемента последовательности $x_t$ представляет собой итерационный процесс: Векторизация входного контекста: Для каждого токена $x_i \in \mathbf{x}$ вычисляется его векторное представление размерности $d_{model}$: $e(x_i) = W_e \cdot one_hot(x_i)$, где $W_e \in \mathbb{R}^{d_{model} \times N}$ — матрица эмбеддингов. Формируется тензор входных вложений: $E = [e(x_1), e(x_2), \dots, e(x_{t-1})] \in \mathbb{R}^{(t-1) \times d_{model}}$. Аддитивное позиционное кодирование: К каждому вектору вложения добавляется позиционный сигнал для учета порядка следования: $H^{(0)} = E + P$, где $P \in \mathbb{R}^{(t-1) \times d_{model}}$ — матрица позиционных кодировок. Трансформерные преобразования (прямой проход): Тензор $H^{(0)}$ последовательно пропускается через $L$ слоев архитектуры Трансформер. На каждом слое $l \in {1, \dots, L}$ выполняются операции: Вычисляются матрицы запросов, ключей и значений путем линейных проекций: $Q_l = H^{(l-1)} W_Q^l; K_l = H^{(l-1)} W_K^l; V_l = H^{(l-1)} W_V^l$. Вычисляется матрица скалярных произведений (Scaled Dot-Product Attention): $A_l = \text{softmax}(\frac{Q_l K_l^T}{\sqrt{d_k}}) V_l$, где $d_k$ — размерность вектора ключа. Результат проходит через слой нормализации по слоям ($LayerNorm$), остаточное соединение и полносвязную сеть прямого распространения ($FFN$) с активацией GELU: $H^{(l)} = FFN(LayerNorm(H^{(l-1)} + A_l)) + (H^{(l-1)} + A_l)$. Логитирование финального скрытого состояния: Извлекается скрытое состояние последнего токена последовательности из выхода последнего слоя: $h_{t-1} = H^{(L)}{t-1} \in \mathbb{R}^{d{model}}$. Вектор умножается на транспонированную матрицу эмбеддингов (парадигма tied weights) или отдельную матрицу весов языка-модели $W_u \in \mathbb{R}^{N \times d_{model}}$: $z = h_{t-1} \cdot W_u^T \in \mathbb{R}^N$. Нормализация вероятностного распределения (Softmax): Логиты $z_j$ нормируются в распределение вероятностей над словарем $V$ посредством функции SoftMax: $\forall j \in {1, \dots, N}: p_\theta(x_t = v_j | \mathbf{x}{<t}) = \frac{\exp(z_j)}{\sum{k=1}^{N} \exp(z_k)}$. Стохастическая или детерминированная селекция (дискретизация): Осуществляется отображение непрерывного распределения $p_\theta$ в конкретный индекс $j^* \in {1, \dots, N}$ согласно заданной стратегии декодирования: Жадный поиск (Greedy search): $j^* = \arg\max_{j} p_\theta(v_j)$. Выборка (Sampling): $j^* \sim p_\theta(\cdot | \mathbf{x}_{<t})$. Сэмплирование с учетом температуры $T > 0$: вероятности пересчитываются как $\tilde{p}j = \frac{\exp(z_j / T)}{\sum{k=1}^{N} \exp(z_k / T)}$, затем $j^* \sim \tilde{p}$. Топ-k/нуклеарное сэмплирование (Top-k/Nucleus sampling): область определения сужается до подмножества $S \subset V$ размера $k$ или кумулятивной вероятности $c$, после чего применяется нормировка $\hat{p}j = \frac{p_j}{\sum{v \in S} p_v}$ и выборка $j^* \sim \hat{p}$. Аппендирование к контексту: Индекс $j^*$ конвертируется обратно в токен $x_t = v_{j^*}$. Последовательность расширяется: $\mathbf{x} \leftarrow (\mathbf{x}, x_t)$. Переменная времени инкрементируется: $t \leftarrow t + 1$. Итерация: Возврат к пункту 1 при невыполнении критериев терминации (не достигнут токен конца последовательности EOS или максимальная длина $T_{max}$). Математически условие остановки выглядит как $(x_t \neq EOS) \land (t < T_{max})$.