AI精选2026年7月19日Transformer 注意力机制详解为什么需要注意力 在 Transformer 之前,处理序列数据的主流方案是 RNN 和 LSTM。它们按顺序逐个处理 token——第 3 个 token 必须等第 2 个 token 算完。 这个"必须等待"带来了两个致命问题:不能并行...Transformer注意力机制深度学习
学习笔记精选2026年6月26日《Attention Is All You Need》论文精读论文背景 2017 年 Vaswani 等人发表的这篇论文只有 6000 多字,却彻底改变了 NLP 和整个 AI 领域。 核心创新 论文最大的创新是用 SelfAttention 替代了 RNN。RNN 的问题是不能并行计算,SelfAt...Transformer论文深度学习