基本信息

来源摘要/节选

公开展示已截断至最多 800 个字符;请访问原始来源查看完整上下文。

为什么需要非线性变化? 在前面的章节中,我们学习了注意力机制和位置编码。但如果仔细观察,你会发现一个问题: 注意力机制全是线性变换! 回顾注意力计算: Q

X ⋅ W Q (线性变换) K

X ⋅ W K (线性变换) V

X ⋅ W V (线性变换) Attention

softmax ( Q ⋅ K T d k ) ⋅ V (softmax是非线性,但后面又是线性) \begin{aligned} Q &= X \cdot W_Q \quad \text{(线性变换)} \\ K &= X \cdot W_K \quad \text{(线性变换)} \\ V &= X \cdot W_V \quad \text{(线性变换)} \\ \text{Attention} &= \text{softmax}\left(\frac{Q \cdot K^T}{\sqrt{d_k}}\right) \cdot V \quad \text{(softmax是非线性,但后面又是线性)} \end{aligned} Q K V Attention ​

X ⋅ W Q ​ (线性变换)

X ⋅ W K ​ (线性变换)

X ⋅ W V ​ (线性变换)

softmax ( d k ​ ​ Q ⋅ K T ​ ) ⋅ V ( softmax 是非线性,但后面又是线性) ​ 虽然softmax提供了一些非线性,但整体来说,注意力机制主要是 线性变换的组合 。 线性变换的局限性 一个众所周知的数学事实: 多个线性变换的组合仍然是线性变换 。…

来源说明

当前只保存了公开页面节选,不代表原文全文。请以原始来源为准。

本页只呈现已做哈希绑定的来源证据,不包含基于旧正文或缺失原文的扩展推断。