词条 · AI · 核心
自一致性
同一个问题让模型独立答多遍,取出现次数最多的答案——不改模型,只靠重复和计票换准确率。
也称:Self-Consistency、self-consistency、重复采样、多数投票、majority voting
先看一个麻烦
你让一个模型算一道有点绕的应用题。它给了个答案,看起来挺像样,推理过程也一步一步写得整齐。你不确定对不对。
于是你把同一道题又问了一遍。它给了个不一样的答案,推理过程同样整齐。
再问一遍,又不一样。
现在你有三个答案,每一个都自称正确,每一个的过程读起来都通顺。你手上没有标准答案——如果有的话你一开始就不用问了。
问题很具体:手上有几份互相矛盾的答案,怎么挑?
几个朴素猜测
猜测一:让它别乱来。把随机性关掉——温度设成 0,每次只取概率最高的那个词。这样三遍问出来的答案就一致了。
一致,但不是对。温度 0 让你每次都走同一条路,包括每次都犯同一个错。你消灭的是分歧,不是错误。而且分歧本身是有信息的:一道题如果它答三遍都是同一个答案,和三遍三个答案,这两种情况你的信心显然不该一样——关掉温度就把这个信号也一起扔了。
猜测二:让它自己挑。把三份答案都摆给它看,问”哪份最好”。
这一步很自然,也是很多流程实际在做的事。但它悄悄要求了一个新能力:模型得能分辨自己的对与错。而这恰恰是它欠的——如果它能可靠识别自己的错误,它第一遍就不会犯。2026 年一篇等成本对照实验直接测了这件事:同样八份样本,让模型挑 vs. 直接数众数,挑的那一边在 5 组配置里输了 2.0 到 17.3 个百分点,一组都没赢过。
猜测三:看它自己说的置信度。让它给每个答案打个分。
模型报的置信度和它实际的正确率对不上,而且错的时候往往报得同样高。用一个不可靠的自评去筛选,只是把问题挪了个位置。
看看这三次撞墙的共同点:都在试图判断哪份答案好。而判断质量恰好是这个模型的弱项。有没有办法绕开判断?
机制
有。不判断,只计票。
把同一道题独立问 遍(温度调高,让每遍真的走不同的路),只抽出每遍的最终答案,扔掉推理过程,数哪个答案出现次数最多。
┌── 采样 1 ── 推理…推理…推理 ──→ 答案 42
│
├── 采样 2 ── 推理…推理…推理 ──→ 答案 42
│
问题 ──┼── 采样 3 ── 推理…推理…推理 ──→ 答案 17
│
├── 采样 4 ── 推理…推理…推理 ──→ 答案 42
│
└── 采样 5 ── 推理…推理…推理 ──→ 答案 91
计票:42→3 17→1 91→1
↓
输出 42
关键在推理过程被丢掉了。它只在生成阶段起作用(让模型有机会走对),在选择阶段完全不参与。选择只看最终答案的字符串重复了几次。
这为什么能行?因为错误是分散的,正确是集中的。一道题只有一个正确答案,但通往错误的路有很多条:这里少乘一次、那里符号弄反、另一处读错条件。五次采样如果错三次,这三次很可能错向三个不同的答案;而对的那两次必然落在同一个答案上。于是即使正确率只有 40%,众数依然可能是对的。
用一个粗糙但够用的模型看:假设单次正确率 ,错误均匀分散在 个不同的错误答案上。那么每个错误答案的单次概率是 。只要 正确答案的期望票数就高于任何单一错误答案, 越大越稳。 越大——也就是错法越五花八门——这个条件越松。
这也解释了它什么时候失效:如果模型有个系统性的偏见,总是错向同一个答案( 且那个错答案概率高于 ),计票会稳定地放大这个错误。重复采样修不了系统偏差,只能压随机波动。
为什么值得知道
它是所有”花更多算力换准确率”方法的基线。这是最实用的一条。任何号称能提升推理质量的技巧——自我批评、重写、多智能体辩论、先规划后执行——都要多花 token。而多花的 token 有一个平凡的用法:多跑几遍取多数。和这个平凡用法比,赢了才算赢。跟只跑一遍的成绩比是没有意义的,因为成本不一样。
2026 年那篇等成本对照就是这么做的:把七种方法实测的 token 数量出来,再给自一致性配同样的预算,逐题配对比较。36 组对照里没有一组赢过配平后的自一致性,10 组显著输。
它需要答案可聚合。“数哪个出现最多”要求答案能精确比对——数值、选项、短字符串可以。写代码、写文章、多轮对话不行:两份都正确的实现可以长得毫无相似之处,众数无从定义。这是它的适用边界,也是自省类方法仍然必要的地方。
它的收益会饱和。票数是在压随机噪声, 从 1 涨到 8 提升明显,从 8 涨到 64 就平了;模型本身够强的时候(单次正确率本来就 90%),可捞的余量也小——那篇论文里 7B 模型上判 vs. 数的差距缩到 2.0 个百分点且不显著。方法的价值和模型的弱点成正比。
分歧率本身是个可用信号。 份答案的分布不只用来投票。如果 8 份里 8 份一致,和 8 份里最高票只占 3 份,后者该被标记为”这道题模型没把握”。很多流程白扔了这个信号——它是你能拿到的、少数几个不依赖模型自评的置信度估计之一。
收束
回到开头:三份互相矛盾的答案,怎么挑。
三个朴素猜测都栽在同一处——它们都要求判断哪份好,而判断质量正是这个模型的弱项。关掉温度只是让分歧消失而错误留下;让模型自选、让它自评置信度,都在向它索取它没有的能力。
自一致性的答案是绕开判断:不问”哪份好”,只问”哪个答案重复得多”。它换来的准确率不来自任何新能力,只来自一个关于错误分布的假设——对只有一种,错有很多种。
所以它的适用条件恰好就是这个假设成立的时候:答案能精确比对(否则无法计票)、错误分散(否则计票放大偏差)、模型有余量可捞(否则没什么可压的噪声)。三条里少一条,它就退化成纯粹的算力浪费。
而它最重要的用途甚至不是拿来提准确率,是拿来当尺子:下次看到一个声称更聪明的推理流程,先问它的 token 花销折算成多少次重复采样,再问它有没有和那个数比过。
来源
提到这个词条的文章
- 自省不如重复采样:等 token 成本下 7 种推理方法的 36 组对照 2026-08-02