2026-07-31AI突现性失准有一张脸:用 Big Five 五条轴代替单一「坏方向」已知一个怪现象:拿「写不安全代码」这种窄而具体的坏数据去微调模型,它会在完全无关的话题上变坏——比如称赞历史暴行、主张人类该被 AI 奴役。alignmentinterpretabilitypersonalityfine-tuning
2026-07-31AI小模型的 PPO 不是不稳定,是接线错了:三个可复现的失败模式「PPO 在小模型上不稳定」是个流传很广的说法,通常的结论是:70M–500M 这个量级要做对齐,就别用 PPO,改用 SFT 或 DPO。rlalignmentpposmall-models