语言模型 · 开放模型 · 长上下文 · 高效 AI

Kimi K3 架构解读:KDA、注意力残差与 LatentMoE

Kimi K3 三层 delta 规则线性注意力配一层全局 MLA,深度上对前置层做注意力,经半宽潜变量路由到 896 选 16 的专家;缩放效率约为 K2 的 2.5 倍。

Kimi K3 架构解读:KDA、注意力残差与 LatentMoE

架构一览

Kimi K3 报告 围绕三条混合轴组织模型:跨 token、跨层、跨通道。沿 token,每个块叠三层 Kimi Delta Attention(KDA)和一层门控多头潜在注意力,末尾再加一层门控 MLA,保证最后一层始终是全局注意力。沿层,注意力残差用对前置层输出的注意力取代单一的累积残差。沿通道,Stable LatentMoE 经 3584 维潜变量(7168 隐层宽度的一半)把每个 token 路由到 896 个专家中的 16 个外加 2 个共享专家。从零训练的视觉塔 MoonViT-V2 接入同一骨干。矩阵用 Muon 训练,注意力投影按头正交化。总量:93 层,2.78T 参数,104.2B 激活,1M token 训练上下文。

关键数字

维度Kimi K2Kimi K3出处同一套评测?
总参数 / 激活参数1.04T / 32.6B2.78T / 104.2BK3 报告表 1不适用
层数 / 注意力头数61 / 6493 / 96表 1不适用
注意力每层 MLA3 KDA : 1 门控 MLA,末尾再加一层门控 MLA表 1,2.1 节不适用
路由专家 / 每 token 激活 / 共享384 / 8 / 1896 / 16 / 2表 1不适用
Latent MoE 维度3584(隐层的 0.5 倍)表 1不适用
每专家 MoE 隐层20483072表 1不适用
训练上下文128K1M表 1不适用
深度混合标准残差块级注意力残差,8 块各 12 层2.2 节不适用
优化器Muon注意力投影上的逐头 Muon2.5 节不适用
缩放效率1 倍约 2.5 倍(拟合缩放律)图 7是,同一实验室的拟合
发布时 WebDev Arena / AA 智能指数排名不适用99 个中第 1(Elo 1678)/ 580 个中第 4(57.1)第三方,2026 年 7 月 23 日不适用

2.5 倍是同一实验室两代模型之间的拟合曲线比较,包含数据和配方的变化;报告没有分别消融 KDA、AttnRes 和 MoE 的改动。

token 混合:KDA 是什么,为什么是 3:1

KDA 是一种线性注意力层,维护固定大小的循环状态,用 delta 规则更新它,即覆盖状态对某个 key 当前的预测而不是在上面累加,并按通道加门,让不同维度以不同速率遗忘。它和 Mamba 的选择性状态空间、Gated DeltaNet 同出一族,继承了它们的性质:每 token 解码代价恒定,没有增长的 KV 缓存。K3 相对 Kimi Linear 改了两处。对数衰减用缩放 sigmoid 设下界,取代无界的负 softplus,使分块计算的每个因果 tile 都能跑稠密的 Tensor Core 矩阵乘,而不是逐位置的显式循环。输出门在逐头 RMSNorm 之后变成依赖输入的满秩投影。

3:1 的比例存在,是因为固定大小的状态做不了精确检索。带压缩 KV 的全局注意力层让每个 token 都可寻址,中间三层便宜的层把长程代价压下来。最后一层全局层保证输出头之前的最后一步计算能看到一切。Qwen3.8-Next 用 Gated DeltaNet 达到同样的 3:1 分配,并发布了背后的受控消融:25B-A3B 上 GDN 混合平均 53.81,全注意力 49.87,滑动窗口混合 51.15。K3 没有发布这个消融,所以 Qwen 的数字是这个比例正确的最好可得证据。

深度混合:注意力残差

残差流把第 L 层之前的一切压成一个向量,报告把它比作沿深度的 RNN。注意力残差让第 L 层以数据相关的权重关注所有前置层的输出,就像自注意力取代了沿位置的递推。对 93 层做完整 AttnRes 代价高,所以 K3 把层分成 8 块各 12 层,在块级表示加嵌入层上做注意力;报告称这找回了大部分收益,并描述了控制推理成本的 online-softmax 实现。这和 DeepSeek V4 的流形约束超连接、Qwen3.8-Next 的四分支门控残差是不同的答案:三者都在加宽或重接残差路径,但只有 K3 把它做成了注意力。

通道混合:Stable LatentMoE

同时扩大专家池和激活专家数能拓宽专业化空间,但常规 MoE 里每个选中的专家都接收完整隐层宽度,通信随路由数目增长。LatentMoE 把模型宽度和路由专家宽度分开:共享专家保留全宽路径,路由专家在 3584 维潜变量上运算。K3 为这种稀疏度加了三个稳定器。专家聚合与上投影之间的 RMSNorm 防止路由分支的尺度随激活的专家而变化。SiTU-GLU,一种 sigmoid-tanh 门控线性单元,给激活的两个分支限界。Quantile Balancing 用一条从分配问题松弛推导、用直方图估计的路由规则取代辅助损失均衡,在 896 选 16 下保持负载均匀。

优化器:逐头 Muon

K3 像 K2 一样用 Muon 训练矩阵,但对 Q、K、V 投影是沿头维度切分动量、分别正交化每个头的块。理由是整矩阵正交化把范数和角色各不相同的头耦合在一起;Pion 论文为 RL 微调独立地得出了同样的逐头设计。DeepSeek V4 用整矩阵 Muon 加 logit 爆炸防护,Qwen3.8-Next 则在发现 Muon 让 MoE 路由器不稳后把路由器留给 AdamW。

局限与存疑

架构作为一个整体连同拟合的 2.5 倍效率增益一起呈现;没有发布逐组件消融,各部分贡献的大小未知。KDA 的 3:1 比例借用了 Qwen 在更小规模上的 GDN 消融作为证据。块级 AttnRes 被描述为找回了完整 AttnRes 的大部分收益,但没有数字。1M 上下文和智能体结果虽强,却是在月之暗面的评测框架下以最大推理强度运行的,刻画的是模型加后训练,而不是架构本身。

常见问题

一段话说清 Kimi K3 的架构是什么?

93 层、2.78T 参数、104.2B 激活的 MoE。每个块有三层 Kimi Delta Attention 和一层门控 MLA;注意力残差让各层以 12 层为块读取所有前置层;Stable LatentMoE 经 3584 维潜变量把 token 路由到 896 个专家中的 16 个;矩阵用逐头 Muon 训练;原生的 MoonViT-V2 塔提供视觉。

Kimi K3 的注意力和 DeepSeek V4 的有什么不同?

K3 每四层中三层用线性 delta 规则注意力(KDA)、第四层用压缩的全局 MLA,所以大多数层没有增长的 KV 缓存。DeepSeek V4 每层都保留注意力,但把成组 token 压成单个 KV 条目并稀疏地关注 top-k,1M token 下把缓存缩到 V3.2 的 10%。两者都加滑动窗口补局部细节。

Kimi K3 里的注意力残差是什么?

一种深度混合机制,每一层以数据相关的权重关注前置层的输出,而不是读取单一的累积残差向量。K3 为控制成本,用 8 块各 12 层的块级变体。

Kimi K3 为什么用 896 个专家却只激活 16 个?

因为 LatentMoE 经半宽潜变量路由 token,扩大专家池不会让通信随激活专家数增长,而 Normalized LatentMoE、SiTU-GLU 和 Quantile Balancing 让训练在这种稀疏度下保持稳定。