Transformer 注意力机制详解
为什么需要注意力 在 Transformer 之前,处理序列数据的主流方案是 RNN 和 LSTM。它们按顺序逐个处理 token——第 3 个 token 必须等第 2 个 token 算完。 这个"必须等待"带来了两个致命问题:不能并行...
为什么需要注意力 在 Transformer 之前,处理序列数据的主流方案是 RNN 和 LSTM。它们按顺序逐个处理 token——第 3 个 token 必须等第 2 个 token 算完。 这个"必须等待"带来了两个致命问题:不能并行...
论文背景 2017 年 Vaswani 等人发表的这篇论文只有 6000 多字,却彻底改变了 NLP 和整个 AI 领域。 核心创新 论文最大的创新是用 SelfAttention 替代了 RNN。RNN 的问题是不能并行计算,SelfAt...
关于这本书 《Deep Learning》2016 年出版,至今仍是 AI 领域最重要的教科书之一。 十个关键收获 1. 表示学习:深度学习的核心不是分类,而是学习好的表示 2. 反向传播:链式法则的工程实现,所有神经网络的训练基础 3. ...