Kimi K3:2.8 万亿参数、百万上下文的开源混合专家模型
Kimi K3 是月之暗面发布的开源 MoE 模型:总参数 2.8 万亿、每 token 激活 1040 亿,原生支持视觉输入和百万 token 上下文,基于 Kimi Delta Attention 架构,并在通用、智能体、编程等方向做了多档推理强度的强化学习后训练。
- 68 星/7日
- 16 引用
- 519 点赞
- #1 mathvision
Kimi K3 是月之暗面发布的开源 MoE 模型:总参数 2.8 万亿、每 token 激活 1040 亿,原生支持视觉输入和百万 token 上下文,基于 Kimi Delta Attention 架构,并在通用、智能体、编程等方向做了多档推理强度的强化学习后训练。
这个 2.0 版本把游戏世界模型的互动时长拉到无限而不掉质量,靠的是精心设计的因果预训练范式;蒸馏出的实时版足以驱动 720p、60 帧的视频流;动作种类也大幅扩展,新增攻击、射箭、施法、射击等,并有更丰富的文本驱动交互元素。
开源大模型越来越重,但本地推理还按“把数据中心的办法缩小”的思路做。FreeToken 围绕本地 AI 的两个现实(智能体负载持续变化、每台机器的资源配比不同),联合设计模型加载、专家驻留、CPU-GPU 协同执行与内存管理,带宽允许时让个人机器也能流畅服务大 MoE 模型。
Prime Agent 是一个开源的长程智能体框架:常驻 IPython 会话让模型用代码做测试时计算,历史、记忆、技能和子智能体配置可以跨任务保留,递归子智能体之间直接通信协作,人类还能随时查看和管理后台会话。
这篇工作为双工语音模型设计了一套流式记忆架构:左脑负责事实信息,右脑负责情绪与个性化,让语音助手在实时对话中同时记住“你说了什么”和“你是怎么说的”。
LLM-as-a-Verifier 让 LLM 当验证器:不再问模型“打分还是不打分”,而是直接从打分 token 的 logits 里算期望,得到免训练的连续反馈信号。作者称在 Terminal-Bench V2、SWE-Bench Verified 等智能体基准上取得当前最好成绩,还做成了 Claude Code 扩展,用于监控智能体并为强化学习提供稠密奖励。
这篇技术报告模仿人类抄写时的工作记忆,设计了一个端到端 OCR 模型:输出文本变长时解码开销基本不变,解决了 LLM 解码器 OCR 随序列变长越来越慢、显存占用越来越高的老问题。
小米机器人团队的视觉-语言-动作基础模型,用 10 万小时以上的真机 UMI 轨迹做预训练,并自动标注场景转换语言,再经后训练适配不同本体和人类的指令式提示。论文称数据量和参数量增加时性能持续提升,在新环境里可以开箱即用,灵巧任务上也能高效微调。
Alaya-EVOKE 把持续的场景几何外置到一个按相机索引的世界状态库,让去噪器的上下文保持有界;再用稀疏注意力教师以线性开销监督长程序列,暴露内容漂移并支持中途改提示词。教师蒸馏成三步学生模型后,作者称单张 H200 上每 1.5 秒片段只需 2.11 秒即可生成。
这篇报告把“持续、可验证地推进真实工作”作为训练目标:一方面扩大可执行文件、搜索、代码环境的多样性与可验证性(环境扩展),另一方面训练智能体拆解长任务、并行委派、整合异步结果并随时重规划(协同扩展)。
这篇技术报告升级了 LingBot-VLA:重构数据管线,用约 6 万小时预训练数据(20 种机器人本体共 5 万小时轨迹,外加 1 万小时第一人称人类视频),并把控制范围从双臂扩展到头部、腰部、移动底盘和灵巧手,目标直指实验室到真实部署之间的落地鸿沟。
AuK 把语音生成和语音编辑统一到同一个开源基础模型里:用户用自然语言描述想要的效果,模型就能合成新语音,或按指令修改已有音频的措辞、音色和声学表现。
这篇工作把上下文学习和循环潜空间推理结合起来:推理时输入持续更新模型的循环记忆,模型在高维潜空间里迭代求解,但不输出中间推理文本。作者报告 150M 参数配置在 ARC-AGI-1 评测集上达到 29.5% pass@2,每题推理成本约 0.0007 美元。
ABot-World-0 是动作条件视频世界模型,用 3A 游戏、仿真引擎和互联网视频的多源数据训练,直接以原始键盘输入操控,并用参考角色记忆保证第三人称滚动的身份一致。作者称单张 RTX 5090 即可流式输出 720p、最高 16 FPS 的交互画面,动作到首帧延迟约 1.2 秒,目标是真正能玩的长程闭环交互。
OSWorld 2.0 是 xlang-ai 团队推出的电脑操作智能体基准,用 108 个基于真实文件、带用户状态的长程工作流任务取代此前的短脚本任务,人类完成一道题的中位数约 1.6 小时。结果相当扎心:表现最好的 Claude Opus 4.8 也只能完成 20.6% 的任务,常常在跟踪约束和结果验证上掉链子。
这是微信团队发布的通用多模态向量模型系列:2B/4B/9B 三个规格,支持文本、图像、视频、视觉文档及任意交错的多模态输入,输出维度可调,训练分两阶段,面向检索、推荐、分类和智能体等场景。
自动化跑通流程不等于结论可靠。AutoResearch 分两阶段:选题阶段持续融合最新研究信号与领域知识,多模型生成加交叉评审,产出可检验的研究计划;执行阶段由协作智能体把计划拆成实验并逐步验证,两头都奔着“有据可查”去。
这篇综述把自我改进的智能体拆成“基础模型 + 提示词、记忆、工具、控制逻辑组成的运行脚手架”,并把“改进”定义为一个自我触发的更新算子:把经验转化为能力积累,尽量少依赖人工。作者按更新对象和驱动信号梳理了大量工作,从改提示词、改记忆一直到权重级的自我修改。
DreamX-World 1.0 是 DreamX 团队的通用交互世界模型:输入文字或图片即可生成可操控的视频世界,支持相机游走、回到之前到过的区域、按提示词触发事件,覆盖写实、游戏和风格化场景。作者称通过少步数自回归设计加速蒸馏,8 张 RTX 5090 上最高可跑到 16 FPS。
Frontis-MA1 附带 OpenMLE 全栈开源系统(任务环境、强化学习算子学习、进化搜索),用来研究递归自我改进;其 350 亿参数元进化智能体围绕 Draft、Improve、Debug、Crossover 四类程序进化算子做后训练,作者称在 MLE-Bench Lite 上超过 GPT-5.5 加 Codex 的组合,组件还能迁移到没见过的 NatureBench Lite。