AI Agent 论文精选

AI Agent 论文精选 · 2026-W37

统计窗口: 2026-06-16 – 2026-09-13 冻结于 2026-09-14

2

FreeToken:把个人电脑当成弹性推理平台,本地跑大型 MoE 模型

开源大模型越来越重,但本地推理还按“把数据中心的办法缩小”的思路做。FreeToken 围绕本地 AI 的两个现实(智能体负载持续变化、每台机器的资源配比不同),联合设计模型加载、专家驻留、CPU-GPU 协同执行与内存管理,带宽允许时让个人机器也能流畅服务大 MoE 模型。

  • 836 星/7日
  • 2 引用
  • 109 点赞
4

LLM-as-a-Verifier:不问裁判式打分,直接从打分 token 读出连续验证分数

LLM-as-a-Verifier 让 LLM 当验证器:不再问模型“打分还是不打分”,而是直接从打分 token 的 logits 里算期望,得到免训练的连续反馈信号。作者称在 Terminal-Bench V2、SWE-Bench Verified 等智能体基准上取得当前最好成绩,还做成了 Claude Code 扩展,用于监控智能体并为强化学习提供稠密奖励。

  • 134 星/7日
  • 11 引用
  • 19 点赞
5

ABot-World-0:单张台式机显卡实时流式运行的动作条件世界模型

ABot-World-0 是动作条件视频世界模型,用 3A 游戏、仿真引擎和互联网视频的多源数据训练,直接以原始键盘输入操控,并用参考角色记忆保证第三人称滚动的身份一致。作者称单张 RTX 5090 即可流式输出 720p、最高 16 FPS 的交互画面,动作到首帧延迟约 1.2 秒,目标是真正能玩的长程闭环交互。

  • 11 星/7日
  • 6 引用
  • 313 点赞
6

OSWorld 2.0:108 个长程真实电脑操作任务,最强智能体也只完成两成

OSWorld 2.0 是 xlang-ai 团队推出的电脑操作智能体基准,用 108 个基于真实文件、带用户状态的长程工作流任务取代此前的短脚本任务,人类完成一道题的中位数约 1.6 小时。结果相当扎心:表现最好的 Claude Opus 4.8 也只能完成 20.6% 的任务,常常在跟踪约束和结果验证上掉链子。

  • 19 星/7日
  • 15 引用
  • 25 点赞
8

智能体自我改进综述:基础模型加脚手架,怎样把经验变成能力积累

这篇综述把自我改进的智能体拆成“基础模型 + 提示词、记忆、工具、控制逻辑组成的运行脚手架”,并把“改进”定义为一个自我触发的更新算子:把经验转化为能力积累,尽量少依赖人工。作者按更新对象和驱动信号梳理了大量工作,从改提示词、改记忆一直到权重级的自我修改。

  • 24 星/7日
  • 9 引用
  • 35 点赞
12

AutoDesign:元优化器带着代码智能体递归自我改进,自动做出学术海报

AutoDesign 把多模态学术海报生成当成长程智能体过程:一个元优化器读取执行反馈、递归改写代码智能体所用的工具 harness。在作者提出的 100 篇论文 PosterBench 上得分超过 Claude Design,学到的 harness 还能迁移提升七种不同代码智能体;全自主循环跑 40 分钟、253 次工具调用,成本不到 3 美元。

  • 21 星/7日
  • 3 引用
  • 63 点赞
13

SEED:把跑通的轨迹蒸馏成可复用技能,边强化学习边自我进化

SEED 让智能体在强化学习中自我进化:把跑通的轨迹改写成自然语言“事后技能”,再把技能带来的行为变化蒸馏回策略,与基于结果的强化学习联合训练,形成一个稠密的 token 级信号。作者称这同时提升了样本效率、最终成绩,以及面对没见过的文本和视觉智能体任务时的泛化能力。

  • 7 星/7日
  • 7 引用
  • 107 点赞
14

Ouroboros:靠“经评审的提交”重写自身工具与核心代码的编程智能体

Ouroboros 是一个自我迭代的编程智能体框架:工具、提示词、上下文组装乃至核心实现都通过“经评审的提交”逐步进化,并成为后续运行的基础,支持递归自由进化和经验驱动核心进化两种模式。作者还报告了长达 161 天、横跨七个人类交流界面的真实部署,强调当智能体开始重写自己时,安全护栏必须始终保持最高权威。

  • 32 星/7日
  • 2 引用
  • 92 点赞
  • #1 osworld-verified
15

Show-Harness:给视觉语言模型一个“语义动作”接口,零样本直接操控机器人

Show-Harness 是一个开源机器人控制框架,把动作拆成视觉语言模型可以直接推理的离散“语义动作单元”,再由确定性的、按机型定制的解释器转成底层机器人指令。作者证明同一套接口既能让闭源前沿模型零样本直接操控机器人,也能让小模型只用几小时 GPU 微调就变成免规划器的策略;配套的 GUMI 浏览器界面还让人或 GUI 智能体无需遥操作硬件就能采集示教数据。

  • 307 星/7日
  • 0 引用
  • 139 点赞

本周 · AI Agent 论文精选