论文背景

2017 年 Vaswani 等人发表的这篇论文只有 6000 多字,却彻底改变了 NLP 和整个 AI 领域。

核心创新

论文最大的创新是用 Self-Attention 替代了 RNN。RNN 的问题是不能并行计算,Self-Attention 可以一次处理整个序列。

关键公式

缩放点积注意力:

Attention(Q,K,V)=softmax(QKTdk)VAttention(Q, K, V) = softmax(\frac{QK^T}{\sqrt{d_k}})V

缩放因子 dk\sqrt{d_k} 的引入是为了防止点积过大导致梯度消失——这是一个精妙的工程细节。

为什么影响深远

Transformer 不仅解决了并行计算问题,更重要的是它证明了”注意力可以单独工作”——不需要 RNN 或 CNN 的辅助。这为后来的 BERT、GPT 系列铺平了道路。

更多技术细节见 Transformer 注意力机制详解