DragMesh-2:靠接触把铰接物体拉开的灵巧手
DragMesh-2 用 51 自由度的手开门、拉抽屉,物体关节无驱动,运动只能靠接触拖出来。PICA 训练标称阻尼下成功率 0.89,4 倍阻尼下仍有 0.56,且无触觉输入。
面向 AI 与科学前沿的重要论文,提供原创结构化解读。
最新
DragMesh-2 用 51 自由度的手开门、拉抽屉,物体关节无驱动,运动只能靠接触拖出来。PICA 训练标称阻尼下成功率 0.89,4 倍阻尼下仍有 0.56,且无触觉输入。
多模态模型 · Shanghai AI Laboratory
InternVideo3 是 8B 视频模型,单次前向在 Video-MME 拿 73.8,套一圈智能体推理再加 2.7。M2LA 让单张 H200 跑到 768K token。
文生图 · Huazhong University of Science and Technology
Moebius 是 0.22B 扩散修复模型,追平 11.9B 的 FLUX.1-Fill-Dev。CelebA-HQ FID 5.39 对 10.13,参数不到 2%,推理约省 15 倍。
Bebop 证明 MTP 接受率在 RL 里被熵上升压住。全变差损失加拒绝采样把接受率稳在约 95%,熵斜率从 -1.68 压到 -0.06,异步 RL 最快提速 1.8 倍,精度不变。
RATs 让机器人在收到指令前先自己玩:agent 团队自提目标、写代码当策略、把成功经验存成可复用技能库,LIBERO-PRO 成功率从 23.2% 升到 43.8%。
冻结特征探针对比 VLM 与视频生成模型:语义任务 VLM 赢(mAP 92.08 对 69.89),几何任务视频模型赢(相机 AUC 0.527 对 0.330),把两者拼起来比谁都强。
用 RL 加 chrF 奖励训练大模型照着上下文翻译,学到的是读上下文而非背语言。五种未见语言上平均 0.3335 chrF,SFT 只有 0.2300,跌破基座。
WorldCraft 让你点物体、画路径,在镜头可控的视频世界模型里把它拖着走。轨迹误差 38.90px,优于 DragAnything 的 39.86,镜头 RPE 仍保持 0.131。
ByG 不用任何配对数据、不用奖励模型,训练图像与视频编辑模型;视频两两对比中以 75.3% 胜率击败用数百万配对训练的 Ditto。
大模型推理 · Shanghai Jiao Tong University
ReRe 让 MLLM 先答一遍空间问题,再看一段合成的新视角视频来修正。免训练,把 Qwen3-VL-2B 在 VSI-Bench 上从 22.5 拉到 31.0(+8.5)。
Kairos 用 40 亿参数、线性时间的混合线性时序注意力,在 PAI-Bench 上拿到 80.84,单张 RTX5090 跑完一次 480P rollout 只要 11.4 秒。
SD3.5-T5 把 Softmax 换成继承预训练 Q/K/V/O 权重的 TTT 层,3000 步微调后 GenEval 0.69,1K 提速 1.32 倍、2K 提速 1.47 倍。
LoomVideo 用一个 5B 模型同时做文生视频、指令编辑和多图生视频,VBench 平均 63.15 追平 13B 的 UniVideo(63.01),编辑速度快 5.41 倍。
CARVE 给每个视频块单独选模态-粒度配置,而不是按查询统一定一种,在去泄漏的 V-RAGBench 上把 Recall@5 从最强基线的 0.510 提到 0.603。
SDPG 给验证器 RL 加一项全词表自蒸馏损失,让看过答案的模型逐 token 监督自己。Qwen3-4B 上 AIME25 从 GRPO 的 0.242 升到 0.327。
World Pilot 给 VLA 外挂两路世界模型先验,LIBERO-Plus 零样本 OOD 拿到 84.7%,比 ABot-M0 高 4.2 分,场景先验来自未训练动作的世界模型也有效
ACE-Ego-0 用 6000 多小时数据做 VLA 预训练,把机器人轨迹和转成伪动作的人类第一视角视频混在一起。六个真机双臂任务平均 78.3%,高于 pi-0.5 的 71.7%。
CPPO 把 PPO 一刀切的裁剪阈值换成早 token 更严的裁剪加一条前缀漂移预算,把 Qwen3-30B-A3B-Base 的 AIME 从 49.23(DPPO)抬到 54.79。
代码生成 · Renmin University of China
DeNovoSWE 自动构建 4818 个可验证的整仓生成任务。用它微调 Qwen3-30B-A3B,BeyondSWE-Doc2Repo 通过率从 0.058 升到 0.472。
强化学习 · Xi'an Jiaotong University
Flow-DPPO 把 PPO 的比值裁剪换成逐步精确的高斯 KL,SD3.5 上 GenEval2 从 39.9(Flow-GRPO)拉到 48.1,策略漂移约降为四分之一。
首个自回归扩散口型同步法:把 14B 双向教师蒸馏成因果学生,每块只跑 2 步去噪,1.3B 跑到 31.58 FPS,首帧延迟亚毫秒。
MemDreamer 把长视频问答变成在三层图记忆上的智能体检索,LVBench 从 78.2 升到 90.7(+12.5),推理只读约 6K token,不是 24 万到 78 万。
AI 智能体 · The Chinese University of Hong Kong
Orchestra-o1 把文本、图像、音频、视频拆给子智能体并行跑,GPT-5 当大脑在 OmniGAIA 拿 72.8%,训练的 8B 编排器拿 30.0%,居开源全模态智能体首位。
ZipSplat 用 k-means 场景 token 预测 3D 高斯,不再一像素一个。DL3DV 上 24.14 PSNR、249K 高斯胜过 YoNoSplat 的 1.2M,免位姿。
ARM 是 7B 自回归模型,用一套下一 token 预测同时做理解、文生图和编辑,底层是共享离散分词器;RL 把 GenEval 从 0.79 提到 0.86。
腾讯优图等机构的综述,用两条轴线梳理从聊天机器人到持续智能体的演进:认知核心(聊天机器人到思考型 LLM)与任务执行(智能体到工作区加技能),主张持续状态才是关键跃迁。
OmniDreams 基于 Cosmos,在单张 GB300 上以 68 FPS 渲染单视角,接入 AlpaSim 闭环替换 NuRec,把事故率从 10.1% 降到 4.7%。
AI 智能体 · City University of Hong Kong
RHO 只用过去的无标注轨迹优化 LLM 智能体的 harness,靠自验证、自一致和成对自偏好,一轮就把 SWE-Bench Pro 通过率从 59% 提到 78%,不用任何外部评分。
DRPO 把 DPPO 的硬散度 mask 换成平滑优势加权二次正则,保留 Binary-TV 信任域但梯度权重有界,在 BF16 和 FP8 下比 GRPO、SPO、DPPO 训得更稳。
SCAIL-2 把原始驱动视频直接拼进生成序列,不再走骨架中间表示,Studio-Bench 上 FVD 287 优于 Wan-Animate 的 305,且一个模型同时做动画和角色替换。
SearchSwarm 在 Tongyi DeepResearch-30B-A3B 上微调 harness 委派轨迹,把 BrowseComp 从 43.4 拉到 68.1,居同规模榜首。
WALL-WM 把 VLA 预训练围绕语义动作事件组织,而非定长动作块。事件模式在真机多样化操作上拿到 75.86 任务进度分,pi0.5 是 55.64。
中科院自动化所综述把 LLM 智能体的交互环境按八条属性轴和八个领域归类,再串起建模、合成、评测、协同进化整条流水线。最锋利的判断:现有环境几乎都撑不起多智能体场景。
APPO 把 RL 分叉点放在高不确定且高影响的 token 上,而非工具调用边界,在 13 个基准上让 Qwen2.5-7B 比 ARPO 高 3.9 分。
Z-Reward 让图像奖励模型预测评分的整条分布而非标量。9B 学生只输出一个 token 就拿到 88.6% 准确率,下游 T2I 相比 SFT 净增 41.3% GSB。
LCLM 把 0.6B 编码器和 4B 解码器联合训练,把长上下文压成软 token,支持 1:4、1:8、1:16,显著降低预填充显存和首 token 延迟,精度接近未压缩基线。
智能体记忆 · National University of Singapore
MRAgent 给 LLM 智能体一张图记忆,让模型边推理边遍历,LoCoMo 的 LLM-Judge 从 68.3 升到 84.2,每样本只花 118k token。
OmniDirector 把参考视频的运镜复制到新生成的视频里,旋转误差降到 2.64 度,优于 CamCloneMaster 的 4.11,且不需要跨配对训练数据。
AI 智能体 · University of Science and Technology of China
Role-Agent 让单个 LLM 既当智能体又当环境,自产过程奖励和课程。Qwen2.5-1.5B 上 ALFWorld 比 GiGPO 高 4.2%,WebShop 高 6.9%。
JKU Linz 团队把 xLSTM、Mamba-2、Gated DeltaNet 放进代码、时序和合成任务里对比,把 xLSTM 的领先拆成两种能力:可外推的计数累积和有限状态跟踪。
EurekAgent 认为瓶颈在环境设计,报告 26-circle packing 2.635999、TriMul 2005.03 微秒、MLE-Bench medal 85.71%。
AI 智能体 · Renmin University of China
FORT-Searcher 用抗捷径任务训练 3B active 搜索智能体,同规模开源总体 66.2;FORT 数据把答案命中时间从 18.7 推迟到 46.9。
HYDRA-X 用单个 ViT 统一图像和视频 tokenization,tubelet attention 与层级时间压缩把 DAVIS rFVD 做到 11.19,编辑总分 4.34。
N-GRPO 用语义邻居混合扰动 rollout embedding,把 1.5B 模型平均 Pass@32 提到 79.17,AIME25 提到 50.28。
Robust-U1 让多模态模型先自恢复受损图像再推理,R-Bench 总分 0.7398,高于 BAGEL 的 0.5770 和 Robust-R1 的 0.5017。
WeaveBench 用 114 个真实 GUI+CLI 长任务测试电脑智能体,最佳组合只有 41.2% 通过率,只看最终产物会把 GPT-5.5 高估 20.2 个点。
ABot-Earth 0.5 用卫星图生成 3D Gaussian Splatting 城市场景,报告每平方公里 10 分钟内生成,FID 为 16.1。
智能体记忆 · National University of Singapore
EvoArena 把静态智能体任务改造成演化链,当前智能体平均准确率只有 39.6%;EvoMem 用 patch memory 将链级准确率提高 3.7 点。
Google DeepMind 报告梳理 AGI 到 ASI 的四条非互斥路径,并把数据墙、资源约束、监管等瓶颈视为开放研究问题。
文生图 · The Chinese University of Hong Kong
InterleaveThinker 给冻结图像生成器加 Planner 和 Critic,UEval 达到 66.3/67.2,WISE 从 0.47 提到 0.73。
Kwai Keye-VL-2.0 是 30B-A3B 开放 MoE 多模态模型,支持 256K 上下文,在长视频、时间定位和代码智能体任务上表现突出。
视觉-语言-动作 · Zhejiang University
LabVLA 用实验室工作流数据训练 Qwen3-VL-4B 加 DiT 动作专家,在 LabUtopia 上达到 71.1% ID 和 70.0% OOD 成功率。
MaxProof 把 MiniMax-M3 当作生成器、验证器、修复器和排序器使用,在 IMO 2025 得到 35/42,USAMO 2026 得到 36/42。
MSA 让每个查询组只看 2048 个被选中的 KV token,在 1M 上下文报告 28.4 倍注意力 FLOPs 降低、14.2 倍 prefill 加速。
SpatialClaw 用持久 Python kernel 替代僵硬工具调用,在 20 个空间推理基准上达到 59.9% 平均准确率,比近期 spatial agent 高 11.2 点。
AI 智能体 · Renmin University of China
Arbor 用持久假设树管理科研尝试,6 个 AO 任务 held-out 结果全胜,MLE-Bench Lite Any Medal 达 86.36%。
AI 智能体 · TokenRhythm Technologies
Claw-SWE-Bench 用 350 个 issue 测 coding-agent harness,完整 adapter 让 OpenClaw Pass@1 升至 73.4%。
专家混合 · Renmin University of China
MPI 让 MoE 路由行对齐专家权重的主奇异方向。11B MoE 平均 benchmark 准确率从 40.92 升到 42.76,训练只慢 0.2%。
AI 智能体 · Independent Researcher
AdaPlanBench:测试智能体自适应规划把约束下的自适应规划变成可检查任务,帮助读者判断系统在哪里失效、结果应如何解读。
ALE 用 1490 个专家构建的专业任务测试智能体,覆盖 55 个数字行业,最难档平均完整通过率只有 2.6%。