跨模型复用 KV 缓存:ridge 回归换掉 7 秒 prefill
NVIDIA 新论文:同家族模型的 KV 缓存之间关系近似线性,一个闭式最小二乘就能换算,比重算快 2.7~25 倍。但六对模型里两对失败——决定成败的不是误差多大,而是误差落在注意力读不读的方向上。
领域
10 篇
NVIDIA 新论文:同家族模型的 KV 缓存之间关系近似线性,一个闭式最小二乘就能换算,比重算快 2.7~25 倍。但六对模型里两对失败——决定成败的不是误差多大,而是误差落在注意力读不读的方向上。
工具名被打乱后前沿模型仍能试探出行为,但中途置换四分之一标识符就让完成率从 93% 掉到 32%,三种扰动叠加更是掉到 3%——不是遗忘,是拒绝用旧地图做演绎。
主流 agent 记忆用 LLM 抽取和合并记忆, 每步都烧 token 且用转述替换原始轨迹。Zero-Mem 只建两个非生成式索引, 记忆操作零 token, 比最快基线快 57.6%。
人工重读全部 500 道题,68 道的题面与标准答案不对应。剔掉它们重排,131 个智能体里 64.1% 名次改变。
同一个冻结模型,只把动作生成挪出关键路径,650ms 截止窗口下成功率 0.50→0.79。瓶颈不在推理能力,在自回归解码的 411ms。
十份 Lean 证书、零个 sorry、三条标准公理,还配了对抗式复核工具。分水岭不在证明对不对,而在 formalization.yaml 里 review.status 写的是 agent-reviewed。
七种「让模型想得更好」的方法,在等 token 预算下和重复采样逐题配对:36 组对照零胜十负,输的全是自省类。
已知一个怪现象:拿「写不安全代码」这种窄而具体的坏数据去微调模型,它会在完全无关的话题上变坏——比如称赞历史暴行、主张人类该被 AI 奴役。
「PPO 在小模型上不稳定」是个流传很广的说法,通常的结论是:70M–500M 这个量级要做对齐,就别用 PPO,改用 SFT 或 DPO。
一则厂商稿称首个桌面 agent 突破 90%。解析 OSWorld 官方评测表核对:成绩属实,但记录同时显示它是智能体框架、启用代码动作、步数上限 100——这三项决定该数字的解读边界。