用 Test-Time Training 线性化 ViT(SD3.5-T5)
SD3.5-T5 把 Softmax 换成继承预训练 Q/K/V/O 权重的 TTT 层,3000 步微调后 GenEval 0.69,1K 提速 1.32 倍、2K 提速 1.47 倍。
机构
中国顶尖研究型大学,其 AI 团队在深度生成模型、扩散模型与机器学习方向产出领先成果。
SD3.5-T5 把 Softmax 换成继承预训练 Q/K/V/O 权重的 TTT 层,3000 步微调后 GenEval 0.69,1K 提速 1.32 倍、2K 提速 1.47 倍。
ACE-Ego-0 用 6000 多小时数据做 VLA 预训练,把机器人轨迹和转成伪动作的人类第一视角视频混在一起。六个真机双臂任务平均 78.3%,高于 pi-0.5 的 71.7%。
AI 智能体 · The Chinese University of Hong Kong
Orchestra-o1 把文本、图像、音频、视频拆给子智能体并行跑,GPT-5 当大脑在 OmniGAIA 拿 72.8%,训练的 8B 编排器拿 30.0%,居开源全模态智能体首位。
腾讯优图等机构的综述,用两条轴线梳理从聊天机器人到持续智能体的演进:认知核心(聊天机器人到思考型 LLM)与任务执行(智能体到工作区加技能),主张持续状态才是关键跃迁。
SCAIL-2 把原始驱动视频直接拼进生成序列,不再走骨架中间表示,Studio-Bench 上 FVD 287 优于 Wan-Animate 的 305,且一个模型同时做动画和角色替换。
SearchSwarm 在 Tongyi DeepResearch-30B-A3B 上微调 harness 委派轨迹,把 BrowseComp 从 43.4 拉到 68.1,居同规模榜首。
OmniDirector 把参考视频的运镜复制到新生成的视频里,旋转误差降到 2.64 度,优于 CamCloneMaster 的 4.11,且不需要跨配对训练数据。
EurekAgent 认为瓶颈在环境设计,报告 26-circle packing 2.635999、TriMul 2005.03 微秒、MLE-Bench medal 85.71%。
WeaveBench 用 114 个真实 GUI+CLI 长任务测试电脑智能体,最佳组合只有 41.2% 通过率,只看最终产物会把 GPT-5.5 高估 20.2 个点。
MaxProof 把 MiniMax-M3 当作生成器、验证器、修复器和排序器使用,在 IMO 2025 得到 35/42,USAMO 2026 得到 36/42。
清华 LongTraceRL 从搜索智能体轨迹挖更难的干扰文档,再加实体级 rubric 奖励,让 Qwen3-4B 五个长上下文基准平均分从 53.3 涨到 59.0。
CHERRL 主动给裁判注入四类已知偏见,让奖励黑客稳定复现;只读训练日志的检测 agent 把六次实验的起点定位区间误差合计压到 11 步,零漏检。
Echo-Infinity 用可学习演化记忆以恒定成本压缩任意长度历史,单张 H100 上 18.5 FPS 实现 24 小时(超 130 万帧)实时生成。
在 20 亿帧动作语料(比此前大 200 倍)上,从约 384 个 PPO 专家蒸馏出因果 Transformer。仿真成功率 92.58 percent,单步推理低于 1.5ms。
Causal Forcing++ 把双向视频扩散蒸馏成 1-2 步逐帧自回归生成器,跑到 14.1 FPS,首帧延迟降一半,少步训练成本砍约 4 倍。