论文背景
2017 年 Vaswani 等人发表的这篇论文只有 6000 多字,却彻底改变了 NLP 和整个 AI 领域。
核心创新
论文最大的创新是用 Self-Attention 替代了 RNN。RNN 的问题是不能并行计算,Self-Attention 可以一次处理整个序列。
关键公式
缩放点积注意力:
缩放因子 的引入是为了防止点积过大导致梯度消失——这是一个精妙的工程细节。
为什么影响深远
Transformer 不仅解决了并行计算问题,更重要的是它证明了”注意力可以单独工作”——不需要 RNN 或 CNN 的辅助。这为后来的 BERT、GPT 系列铺平了道路。
更多技术细节见 Transformer 注意力机制详解。