RL 让大模型学会从上下文翻译没见过的语言
用 RL 加 chrF 奖励训练大模型照着上下文翻译,学到的是读上下文而非背语言。五种未见语言上平均 0.3335 chrF,SFT 只有 0.2300,跌破基座。
机构
欧洲顶尖理工大学,机器人系统实验室与机器学习团队在机器人与机器人学习方向有领先研究。
用 RL 加 chrF 奖励训练大模型照着上下文翻译,学到的是读上下文而非背语言。五种未见语言上平均 0.3335 chrF,SFT 只有 0.2300,跌破基座。
ZipSplat 用 k-means 场景 token 预测 3D 高斯,不再一像素一个。DL3DV 上 24.14 PSNR、249K 高斯胜过 YoNoSplat 的 1.2M,免位姿。
来自 ETH、斯坦福、TU Darmstadt 与 IIT 的立场论文主张:堆大 VLA 和世界模型不够,机器人真正缺的是把无标注人类与视频行为转成可训练监督信号的四个数据接口。