基本信息
- 来源: juejin
- 原始来源: https://juejin.cn/post/7610636104945680403
来源摘要/节选
公开展示已截断至最多 800 个字符;请访问原始来源查看完整上下文。
为什么需要非线性变化? 在前面的章节中,我们学习了注意力机制和位置编码。但如果仔细观察,你会发现一个问题: 注意力机制全是线性变换! 回顾注意力计算: Q
X ⋅ W Q (线性变换) K
X ⋅ W K (线性变换) V
X ⋅ W V (线性变换) Attention
softmax ( Q ⋅ K T d k ) ⋅ V (softmax是非线性,但后面又是线性) \begin{aligned} Q &= X \cdot W_Q \quad \text{(线性变换)} \\ K &= X \cdot W_K \quad \text{(线性变换)} \\ V &= X \cdot W_V \quad \text{(线性变换)} \\ \text{Attention} &= \text{softmax}\left(\frac{Q \cdot K^T}{\sqrt{d_k}}\right) \cdot V \quad \text{(softmax是非线性,但后面又是线性)} \end{aligned} Q K V Attention
X ⋅ W Q (线性变换)
X ⋅ W K (线性变换)
X ⋅ W V (线性变换)
softmax ( d k Q ⋅ K T ) ⋅ V ( softmax 是非线性,但后面又是线性) 虽然softmax提供了一些非线性,但整体来说,注意力机制主要是 线性变换的组合 。 线性变换的局限性 一个众所周知的数学事实: 多个线性变换的组合仍然是线性变换 。…
来源说明
当前只保存了公开页面节选,不代表原文全文。请以原始来源为准。
本页只呈现已做哈希绑定的来源证据,不包含基于旧正文或缺失原文的扩展推断。