ACE-Ego-0:把人类第一视角视频和机器人数据统一进 VLA 预训练
ACE-Ego-0 用 6000 多小时数据做 VLA 预训练,把机器人轨迹和转成伪动作的人类第一视角视频混在一起。六个真机双臂任务平均 78.3%,高于 pi-0.5 的 71.7%。
机构
香港的顶尖研究型大学,其 MMLab(多媒体实验室)是计算机视觉与多模态 AI 研究的重要重镇。
ACE-Ego-0 用 6000 多小时数据做 VLA 预训练,把机器人轨迹和转成伪动作的人类第一视角视频混在一起。六个真机双臂任务平均 78.3%,高于 pi-0.5 的 71.7%。
AI 智能体 · The Chinese University of Hong Kong
Orchestra-o1 把文本、图像、音频、视频拆给子智能体并行跑,GPT-5 当大脑在 OmniGAIA 拿 72.8%,训练的 8B 编排器拿 30.0%,居开源全模态智能体首位。
文生图 · The Chinese University of Hong Kong
InterleaveThinker 给冻结图像生成器加 Planner 和 Critic,UEval 达到 66.3/67.2,WISE 从 0.47 提到 0.73。
MaxProof 把 MiniMax-M3 当作生成器、验证器、修复器和排序器使用,在 IMO 2025 得到 35/42,USAMO 2026 得到 36/42。
多模态模型 · The Chinese University of Hong Kong
X-Stream 是首个多路并发视频流理解基准。最强的 Gemini 3 Pro 仅 49.6%,人类却有 91.84%,主动反应能力更跌破 21%。