资讯
Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配
📌 概要
3Blue1Brown 从 2017 年论文《Attention Is All You Need》出发,用“形容词修饰名词”的简化例子,一步步拆解注意力头如何把上下文融入每个 token 的嵌入表示。片中讲解查询、键、值向量与点积、Softmax 如何计算注意力模式,用掩码阻止后续 token 影响前面,再以加权和更新嵌入;并扩展到多头注意力、自注意力与交叉注意力、低秩映射和参数规模,最后指出并行
⚡ 关键要点
- ▸3Blue1Brown 从 2017 年论文《Attention Is All You Need》出发,用“形容词修饰名

3Blue1Brown 从 2017 年论文《Attention Is All You Need》出发,用“形容词修饰名词”的简化例子,一步步拆解注意力头如何把上下文融入每个 token 的嵌入表示。片中讲解查询、键、值向量与点积、Softmax 如何计算注意力模式,用掩码阻止后续 token 影响前面,再以加权和更新嵌入;并扩展到多头注意力、自注意力与交叉注意力、低秩映射和参数规模,最后指出并行化是 GPT-3 等大模型成功的关键。 -----------------------------------