2026-08-06AI跨模型复用 KV 缓存:ridge 回归换掉 7 秒 prefillNVIDIA 新论文:同家族模型的 KV 缓存之间关系近似线性,一个闭式最小二乘就能换算,比重算快 2.7~25 倍。但六对模型里两对失败——决定成败的不是误差多大,而是误差落在注意力读不读的方向上。llminferencekv-cacheevaluation