Elea Notes.

词条 · AI ·

推理

模型训练完成后实际使用它的过程——你提问、它输出,这一步的成本决定了服务价格。

也称:inference、推理阶段、解码

一句话

训练是造模型,推理是用模型。训练一次性花钱,推理每次调用都花钱。

两个阶段,性质完全不同

预填充:读入你的问题。所有词可以并行处理,吃满算力,很快。

解码:逐字生成回答。必须一个一个来——写下一个字要先看到上一个字。这一步不缺算力,缺的是显存带宽:每生成一个字,都要把模型权重和缓存搬一遍。

这解释了一个常见观察:模型”读”很长的文档很快,但”写”一段长回答明显慢。两个阶段的瓶颈不在同一处。

为什么这件事重要

训练成本是新闻头条,推理成本是商业现实。一个模型如果每天被调用上亿次,推理的总花费会远超训练。所以大量工程努力都花在同一件事上:让解码这一步更便宜