词条 · AI ·
Transformer
当前几乎所有大模型的基础架构,核心是让每个词直接权衡它该关注哪些词。
也称:transformer、注意力机制、attention、self-attention、自注意力
一句话
处理一句话时,不按顺序一个个读,而是让每个词同时看到所有词,各自决定该关注谁。
打个比方
理解”他把杯子放在桌上,因为它太烫了”这句话时,你需要知道”它”指杯子还是桌子。人靠常识瞬间判断。
注意力机制做的是类似的事:处理”它”这个词时,模型给句中每个词打一个相关度分数,然后按分数加权地把信息汇总过来。杯子分数高,桌子分数低,于是”它”的表示里主要混入了杯子的信息。
为什么它赢了
之前的主流做法(循环网络)像读书一样逐词推进,前一个词处理完才能处理下一个。两个问题:慢(无法并行),且远距离信息容易丢(隔了五十个词,早期信息被逐步冲淡)。
Transformer 里任意两个词直接连通,距离不再衰减,而且整句可以并行计算。这个特性正好契合 GPU 的算力形态,于是模型规模得以爆炸式增长。
代价
每个词都要和所有词比对,计算量随句子长度的平方增长。一千个词是一百万次比对,一万个词就是一亿次。这就是长上下文昂贵的根源,也是大量后续研究要解决的问题。
来源
- Attention Is All You Need · arXiv