世界模型 · 机器人 · 高效 AI

Kairos:面向具身智能的 4B 原生世界模型栈

Kairos 用 40 亿参数、线性时间的混合线性时序注意力,在 PAI-Bench 上拿到 80.84,单张 RTX5090 跑完一次 480P rollout 只要 11.4 秒。

Kairos:面向具身智能的 4B 原生世界模型栈

快速答案

Kairos 是一个 40 亿参数的世界模型,被做成一套可部署的栈,而不是单独的视频生成器。它最核心的工程赌注是混合线性时序注意力:把时间拆成三路,滑动窗口管局部动态,膨胀滑动窗口管中程依赖,门控线性注意力维持长期全局记忆,生成成本因此从 O(n 平方) 降到 O(n)。通用版 4B 模型在 PAI-Bench 上拿到 80.84,WorldModelBench 8.94;机器人版在 PAI-Bench-robot 上是 80.03。单张消费级 RTX5090 跑一次 480P rollout 只要 11.4 秒,四张 A800 则是 3.0 秒。真正算新东西的科学主张是定理 2:它给出一个形式化上界,说明只要全局记忆那一路是收缩的,这种时间分解就能压住长程误差,不让它发散。

「原生世界模型栈」到底指什么

三个动词:学世界、维持世界、跑世界。学世界靠一条跨具身数据课程,把开放世界视频、约 10 万小时人类行为数据、机器人交互日志按发育路径分阶段排序,训练分辨率从 256P 一路升到 720P,帧数从 1 帧到 241 帧。维持世界靠下面那套统一架构。跑世界靠面向部署的协同设计,同时覆盖服务器 GPU(A800/A100)和消费级硬件(RTX5090,还有 METAX C500)。

三根支柱里有两根是包装。数据课程和部署工作都是扎实的工程,但属于任何资源充足的实验室都能攒出来的东西。值得细看的是注意力机制,以及挂在它上面的那条上界。

混合线性时序注意力怎么压住漂移

长程世界模型的失败方式都一样:每一步的小误差不断累积,直到 rollout 发散。Kairos 的做法是按尺度拆分时序记忆,而不是对整段历史跑满二次注意力。局部细节交给滑动窗口,中程结构交给膨胀窗口,长尾交给带 delta 更新规则的门控线性注意力那一路,后者充当长期记忆。这跟 Full Attention Strikes Back 以及 MiniMax 稀疏注意力 是同一种线性化思路,只不过用在了生成式 rollout 的时间轴上,而不是文本上下文上。

定理 2 是这篇论文真正立得住的地方。它说:若全局记忆那一路用收缩因子 rho 小于 1 的门控 delta 更新,且混合预测器对真实分量的逼近误差不超过 epsilon,则当 t 趋于无穷时,超额风险被约束在约 (Lepsilon + L_Gxi / (1 - rho)) 的平方之内,其中 L 和 L_G 是 Lipschitz 常数。要看的是假设,不是标题。这条上界只在记忆更新确实收缩时成立,而收缩因子 rho 是一个学出来的经验属性,架构本身并不保证它。定理说的是在这些条件下漂移不会无界累积,它没说漂移很小。

为什么 4B 这个体量才是重点

一个 4B 模型在 PAI-Bench 上压过 2B 和 14B 的 Cosmos 2.5,这才是「效率-能力」主张的发力点。重点不是 Kairos 在每个指标上都赢更大的模型,而是线性注意力让 rollout 的推理成本随时间线性增长,而二次的 baseline 随平方增长,所以生成越久,差距越大。这才让单卡 RTX5090 部署有了可能。跟 pi0 流匹配 VLA 这种以策略为产品的系统不同,这里世界模型本身才是策略要去 rollout 的底座,更接近一个 世界-动作模型,而非纯视频生成器。

关键结果

  • PAI-Bench: 通用版 Kairos 3.0-4B 拿到 80.84,Kairos-Robot 480P 拿到 80.03,论文称领先 Cosmos 2.5(2B 与 14B)、WAN 2.2-5B 和 Lingbot。
  • WorldModelBench: 通用版 8.94;机器人版在 WorldModelBench-robot TI2V 上为 9.08。
  • DreamGen Bench(机器人): Kairos-Robot 物理对齐 0.529,指令跟随 0.609。
  • VideoPHY: 通用 4B 模型 45.55,这是一个物理合理性基准。
  • 推理延迟(480P): 单张 A800 11.7 秒(占用 23.5GB),四张 A800 3.0 秒,单张消费级 RTX5090 11.4 秒。
  • 复杂度: 混合算子在时间长度上是 O(n),而满时序注意力是 O(n 平方),图 3(c) 显示 rollout 变长时每步 DiT 推理时间基本持平。

怎么读这个标题

这里说的 SOTA,是 4B 体量下的基准领先,这跟「打赢前沿规模模型」是两回事,也更有用。诚实的比较是每参数、每秒延迟下的能力,在这个轴上线性注意力设计确实在干活。但有两点要小心。第一,世界模型的基准成绩一部分来自训练数据和评测 harness,不只是架构;10 万小时人类数据的跨具身课程是一道护城河,跟注意力的数学没关系。第二,那条理论上界是有界性保证,不是小量保证,而且它依赖一个论文没在真实 rollout 上测过的收缩假设。

局限与存疑

最大的缺口是:那条形式化上界的核心假设,即门控 delta 更新收缩、rho 小于 1,是被当成条件写出来的,并没有在训练好的 checkpoint 上做经验验证。rho 没测出来,这个保证就是有条件的。论文给了领先分数,但在可见正文里没有一份把三路注意力各自贡献拆开的消融,所以膨胀窗口和门控线性记忆谁更重要并不清楚。PAI-Bench 80.84 这类成绩在可见表格里是单点,没有方差或种子。效率数字是 480P 下的延迟,没给课程最终训到的 720P/241 帧那档的吞吐。所谓消费级部署,11.4 秒一次 480P rollout 用于离线生成没问题,但离摘要里说的实时「观察-动作-反馈」回路还差得远。

常见问题

Kairos 真的证明了长程误差累积的形式化上界吗?

有条件地证明了。定理 2 说:若全局记忆那一路的门控 delta 更新收缩因子 rho 小于 1,且混合预测器对真实动态的逼近误差不超过 epsilon,则当 t 增大时超额风险被约束在约 (Lepsilon + L_Gxi / (1 - rho)) 的平方内。它保证在这些假设下误差不会无界增长,但没证明误差很小,而且 rho 在可见正文里没有在训练好的模型上被测量。

Kairos 怎么在单张 RTX5090 上跑世界模型?

混合线性时序注意力算子在时间长度上是 O(n) 而非 O(n 平方),所以 rollout 变长时每步推理成本基本持平(图 3c)。一次 480P rollout 在 RTX5090 上 11.4 秒,单张 A800 上 11.7 秒占 23.5GB,四张 A800 拆开则 3.0 秒。线性扩展正是消费级硬件能跑长生成的原因。

Kairos-4B 对比 Cosmos 2.5 成绩如何?

4B 的 Kairos 3.0 在 PAI-Bench 上 80.84,机器人版 80.03,论文称领先 2B 和 14B 的 Cosmos 2.5、WAN 2.2-5B 和 Lingbot。框架是每参数能力:一个 4B 模型领先到 14B 的对手,靠的是线性时间 rollout 而非堆规模。

混合线性时序注意力的三路分别是什么?

三个时间尺度。滑动窗口注意力抓局部动态,膨胀滑动窗口抓中程依赖,带 delta 更新规则的门控线性注意力维持长期全局记忆。这样拆分时间,模型才能降到 O(n) 成本同时保留长程记忆,这也是定理 2 的误差上界所依赖的结构。

一句话:Kairos 押的是,一个用线性时间时序注意力、在 PAI-Bench 上拿 80.84、单张 RTX5090 上 11.4 秒跑完的 4B 世界模型,比一个更大的二次模型更适合做具身智能的底座。读 arXiv 原文