强化学习 · GRPO vs PPO
GRPO 和 PPO 的区别:去掉价值模型换来了什么
GRPO 用同组采样答案的平均奖励替代 PPO 学习出来的价值模型,少一个和策略同样大的模型,让开源推理 RL 变得可负担,代价是失去逐 token 的信用分配并带来新的不稳定。
对比
方法与模型的正面对比,数字来自原论文。
强化学习 · GRPO vs PPO
GRPO 用同组采样答案的平均奖励替代 PPO 学习出来的价值模型,少一个和策略同样大的模型,让开源推理 RL 变得可负担,代价是失去逐 token 的信用分配并带来新的不稳定。
扩散语言模型 · Diffusion language models vs Autoregressive language models
8B 的掩码扩散语言模型已能在 MMLU 上打平同尺寸自回归模型、在 GSM8K 上领先,只用六分之一的 token,还解决了反转诅咒。解码速度、短提示条件生成和服务栈成熟度仍偏向自回归。
微调与适配 · LoRA vs Full fine-tuning
标准任务上 LoRA 与全量微调只差一分以内,可训练参数少一万倍;但它靠的是入侵维度,这些方向承担了遗忘,起初有利,持续训练下反而吃亏。
序列建模 · Mamba vs Transformer
Mamba 用固定大小的选择性状态换掉注意力的平方计算和 KV 缓存:解码吞吐 5 倍、3B 上打平两倍大的 Transformer,但精确回忆仍属于注意力。
语言模型 · Muon vs AdamW
Muon 预训练用约一半 FLOPs 达到 AdamW 的损失,DeepSeek-V4、Kimi K3 已采用;用于 AdamW 模型的 SFT 会丢分,RL 里会崩。
长上下文 · Sparse attention vs Full attention
稀疏注意力在 100 万 token 上把注意力计算量压到 1/7 到 1/28,长上下文基准只掉半分左右;但实际耗时的收益远小于 FLOPs 的收益,32K 以下几乎看不见。
世界模型 · World models vs LLMs
大语言模型用语言在规则和目标上推理,世界模型预测一个场景接下来会怎样。2026 年的证据说两者互补,难点在第三种能力:判断一段生成出来的未来可信到什么程度,能不能据此行动。