AI 研究论文总榜

AI 研究论文总榜 · 2026-W37

统计窗口: 2026-06-16 – 2026-09-13 冻结于 2026-09-14

3

FreeToken:把个人电脑当成弹性推理平台,本地跑大型 MoE 模型

开源大模型越来越重,但本地推理还按“把数据中心的办法缩小”的思路做。FreeToken 围绕本地 AI 的两个现实(智能体负载持续变化、每台机器的资源配比不同),联合设计模型加载、专家驻留、CPU-GPU 协同执行与内存管理,带宽允许时让个人机器也能流畅服务大 MoE 模型。

  • 836 星/7日
  • 2 引用
  • 109 点赞
6

LLM-as-a-Verifier:不问裁判式打分,直接从打分 token 读出连续验证分数

LLM-as-a-Verifier 让 LLM 当验证器:不再问模型“打分还是不打分”,而是直接从打分 token 的 logits 里算期望,得到免训练的连续反馈信号。作者称在 Terminal-Bench V2、SWE-Bench Verified 等智能体基准上取得当前最好成绩,还做成了 Claude Code 扩展,用于监控智能体并为强化学习提供稠密奖励。

  • 134 星/7日
  • 11 引用
  • 19 点赞
8

小米机器人一号:10 万小时以上真机轨迹预训练的视觉-语言-动作模型

小米机器人团队的视觉-语言-动作基础模型,用 10 万小时以上的真机 UMI 轨迹做预训练,并自动标注场景转换语言,再经后训练适配不同本体和人类的指令式提示。论文称数据量和参数量增加时性能持续提升,在新环境里可以开箱即用,灵巧任务上也能高效微调。

  • 13 星/7日
  • 15 引用
  • 75 点赞
  • #3 robocasa
9

Alaya-EVOKE:线性扩展的长程监督加显式世界状态记忆,让世界持续演化

Alaya-EVOKE 把持续的场景几何外置到一个按相机索引的世界状态库,让去噪器的上下文保持有界;再用稀疏注意力教师以线性开销监督长程序列,暴露内容漂移并支持中途改提示词。教师蒸馏成三步学生模型后,作者称单张 H200 上每 1.5 秒片段只需 2.11 秒即可生成。

  • 93 星/7日
  • 2 引用
  • 166 点赞
  • #2 wbench-navigation-split
11

LingBot-VLA 2.0:6 万小时、20 种本体数据预训练的视觉-语言-动作模型

这篇技术报告升级了 LingBot-VLA:重构数据管线,用约 6 万小时预训练数据(20 种机器人本体共 5 万小时轨迹,外加 1 万小时第一人称人类视频),并把控制范围从双臂扩展到头部、腰部、移动底盘和灵巧手,目标直指实验室到真实部署之间的落地鸿沟。

  • 20 星/7日
  • 15 引用
  • 21 点赞
  • #3 robotwin-2-0-easy-50-tasks
14

ABot-World-0:单张台式机显卡实时流式运行的动作条件世界模型

ABot-World-0 是动作条件视频世界模型,用 3A 游戏、仿真引擎和互联网视频的多源数据训练,直接以原始键盘输入操控,并用参考角色记忆保证第三人称滚动的身份一致。作者称单张 RTX 5090 即可流式输出 720p、最高 16 FPS 的交互画面,动作到首帧延迟约 1.2 秒,目标是真正能玩的长程闭环交互。

  • 11 星/7日
  • 6 引用
  • 313 点赞
15

OSWorld 2.0:108 个长程真实电脑操作任务,最强智能体也只完成两成

OSWorld 2.0 是 xlang-ai 团队推出的电脑操作智能体基准,用 108 个基于真实文件、带用户状态的长程工作流任务取代此前的短脚本任务,人类完成一道题的中位数约 1.6 小时。结果相当扎心:表现最好的 Claude Opus 4.8 也只能完成 20.6% 的任务,常常在跟踪约束和结果验证上掉链子。

  • 19 星/7日
  • 15 引用
  • 25 点赞
18

智能体自我改进综述:基础模型加脚手架,怎样把经验变成能力积累

这篇综述把自我改进的智能体拆成“基础模型 + 提示词、记忆、工具、控制逻辑组成的运行脚手架”,并把“改进”定义为一个自我触发的更新算子:把经验转化为能力积累,尽量少依赖人工。作者按更新对象和驱动信号梳理了大量工作,从改提示词、改记忆一直到权重级的自我修改。

  • 24 星/7日
  • 9 引用
  • 35 点赞
20

Frontis-MA1:开源的 350 亿“元进化”智能体,递归改进自己的机器学习工程

Frontis-MA1 附带 OpenMLE 全栈开源系统(任务环境、强化学习算子学习、进化搜索),用来研究递归自我改进;其 350 亿参数元进化智能体围绕 Draft、Improve、Debug、Crossover 四类程序进化算子做后训练,作者称在 MLE-Bench Lite 上超过 GPT-5.5 加 Codex 的组合,组件还能迁移到没见过的 NatureBench Lite。

  • 34 星/7日
  • 3 引用
  • 186 点赞

本周 · AI 研究论文总榜