Elea Notes.

词条 · AI ·

Transformer

当前几乎所有大模型的基础架构,核心是让每个词直接权衡它该关注哪些词。

也称:transformer、注意力机制、attention、self-attention、自注意力

一句话

处理一句话时,不按顺序一个个读,而是让每个词同时看到所有词,各自决定该关注谁。

打个比方

理解”他把杯子放在桌上,因为太烫了”这句话时,你需要知道”它”指杯子还是桌子。人靠常识瞬间判断。

注意力机制做的是类似的事:处理”它”这个词时,模型给句中每个词打一个相关度分数,然后按分数加权地把信息汇总过来。杯子分数高,桌子分数低,于是”它”的表示里主要混入了杯子的信息。

为什么它赢了

之前的主流做法(循环网络)像读书一样逐词推进,前一个词处理完才能处理下一个。两个问题:(无法并行),且远距离信息容易丢(隔了五十个词,早期信息被逐步冲淡)。

Transformer 里任意两个词直接连通,距离不再衰减,而且整句可以并行计算。这个特性正好契合 GPU 的算力形态,于是模型规模得以爆炸式增长。

代价

每个词都要和所有词比对,计算量随句子长度的平方增长。一千个词是一百万次比对,一万个词就是一亿次。这就是长上下文昂贵的根源,也是大量后续研究要解决的问题。

来源

  1. Attention Is All You Need · arXiv