DragMesh-2:靠接触把铰接物体拉开的灵巧手
DragMesh-2 用 51 自由度的手开门、拉抽屉,物体关节无驱动,运动只能靠接触拖出来。PICA 训练标称阻尼下成功率 0.89,4 倍阻尼下仍有 0.56,且无触觉输入。
机构
位于北京的中国顶尖研究型大学,在自然语言处理、多模态学习与人工智能研究方面成果突出。
DragMesh-2 用 51 自由度的手开门、拉抽屉,物体关节无驱动,运动只能靠接触拖出来。PICA 训练标称阻尼下成功率 0.89,4 倍阻尼下仍有 0.56,且无触觉输入。
WorldCraft 让你点物体、画路径,在镜头可控的视频世界模型里把它拖着走。轨迹误差 38.90px,优于 DragAnything 的 39.86,镜头 RPE 仍保持 0.131。
LoomVideo 用一个 5B 模型同时做文生视频、指令编辑和多图生视频,VBench 平均 63.15 追平 13B 的 UniVideo(63.01),编辑速度快 5.41 倍。
AI 智能体 · The Chinese University of Hong Kong
Orchestra-o1 把文本、图像、音频、视频拆给子智能体并行跑,GPT-5 当大脑在 OmniGAIA 拿 72.8%,训练的 8B 编排器拿 30.0%,居开源全模态智能体首位。
SearchSwarm 在 Tongyi DeepResearch-30B-A3B 上微调 harness 委派轨迹,把 BrowseComp 从 43.4 拉到 68.1,居同规模榜首。
MaxProof 把 MiniMax-M3 当作生成器、验证器、修复器和排序器使用,在 IMO 2025 得到 35/42,USAMO 2026 得到 36/42。
MSA 让每个查询组只看 2048 个被选中的 KV token,在 1M 上下文报告 28.4 倍注意力 FLOPs 降低、14.2 倍 prefill 加速。
AI 智能体 · TokenRhythm Technologies
Claw-SWE-Bench 用 350 个 issue 测 coding-agent harness,完整 adapter 让 OpenClaw Pass@1 升至 73.4%。
综述把长视频 MLLM 重构为「看-记-想」三种能力,对比 11 篇已有综述,梳理 100+ 方法与 5 个应用领域。
TrOPD 只在教师真正可信的 token 上做在线策略蒸馏,在数学、代码、STEM 上比标准 OPD 平均高出 3.06 到 3.52 分。
Video2GUI 把 5 亿条无标注教程视频自动转成 WildGUI 数据集——1200 万条 GUI 交互轨迹,在其上预训练让多项 GUI 基准提升 5-20%。