Self-Attention 让每个位置「关注」序列中所有位置:用 Query 与 Key 的点积计算相似度,Softmax 归一化后与 Value 加权求和。
相关演示
卷积网络处理图像,序列模型处理文本,Transformer 统一了现代 NLP 与多模态架构。
可用 ← → 键切换主题
Query · Key · Value · Softmax
学完演示后来检验一下。全部答对即可标记本章测验通过。
1. 卷积层共享权重的主要好处是?
2. Self-Attention 中 Query 与 Key 的点积用来?
3. Transformer 相对 RNN 的重要优势是?
Query 词:「机器」
Self-Attention 让每个位置「关注」序列中所有位置:用 Query 与 Key 的点积计算相似度,Softmax 归一化后与 Value 加权求和。
相关演示