Kimi K3 论文解读:Delta 注意力、注意力残差与 896 个专家
Kimi K3 是 2.8T 参数、104B 激活的 MoE,由 3:1 的 KDA 与门控 MLA、注意力残差和 896 专家 LatentMoE 构成,缩放效率为 K2 的 2.5 倍。
机构
北京 AI 实验室,Kimi 系列模型、Kimi Delta Attention 与规模化 Muon 优化器的出品方。
Kimi K3 是 2.8T 参数、104B 激活的 MoE,由 3:1 的 KDA 与门控 MLA、注意力残差和 896 专家 LatentMoE 构成,缩放效率为 K2 的 2.5 倍。
Moonshot 证明 Muon 加权重衰减和更新量缩放后,能以约一半算力达到 AdamW 的损失;5.7T token 训出的 16B MoE 模型 Moonlight 是证据。