Как работают нейросети
Как обрабатывается текст в Transformer-модели Допустим, у нас есть текст из 10 слов. После токенизации он превратился в 20 токенов: [154, 27, 891, 42, ..., 517] 1. Токены превращаются в векторы У модели есть матрица эмбеддингов. EmbeddingMatrix [Размер словаря × 4096] Каждая строка соответствует одному токену. 154 → [0.32, -1.17, ..., 0.11] 27 → [-0.55, 0.81, ..., 0.42] 891 → [1.03, -0.27, ..., -0.15] После замены всех токенов на их векторы получаем матрицу: 20 токенов × 4096 чисел X = [20 × 4096] 2. Первый слой Transformer Модель берёт сразу всю матрицу: X = [20 × 4096] и умножает её на обученные матрицы весов: Q = X × Wq K = X × Wk V = X × Wv Q = [20 × 4096] K = [20 × 4096] V = [20 × 4096] 3. Механизм внимания (Attention) Теперь модель вычисляет: Q × Kᵀ Размер результата: [20 × 4096] × [4096 × 20] = [20 × 20] Получается матрица связей между токенами. кот сидит на ковре кот: 8 2 1 1 сидит: 3 7 2 1 на: 1 2 6 4 ковре: 1 1 3 8 4. Обмен ко...