强化学习 · University of Zurich RL 让大模型学会从上下文翻译没见过的语言 用 RL 加 chrF 奖励训练大模型照着上下文翻译,学到的是读上下文而非背语言。五种未见语言上平均 0.3335 chrF,SFT 只有 0.2300,跌破基座。