代码生成 · Renmin University of China
DeNovoSWE:4818 个自动构建的仓库,训练整仓代码智能体
DeNovoSWE 自动构建 4818 个可验证的整仓生成任务。用它微调 Qwen3-30B-A3B,BeyondSWE-Doc2Repo 通过率从 0.058 升到 0.472。
机构
中国人民大学,其高瓴人工智能学院是活跃的自然语言处理与大模型研究团队。
代码生成 · Renmin University of China
DeNovoSWE 自动构建 4818 个可验证的整仓生成任务。用它微调 Qwen3-30B-A3B,BeyondSWE-Doc2Repo 通过率从 0.058 升到 0.472。
SearchSwarm 在 Tongyi DeepResearch-30B-A3B 上微调 harness 委派轨迹,把 BrowseComp 从 43.4 拉到 68.1,居同规模榜首。
AI 智能体 · Renmin University of China
FORT-Searcher 用抗捷径任务训练 3B active 搜索智能体,同规模开源总体 66.2;FORT 数据把答案命中时间从 18.7 推迟到 46.9。
AI 智能体 · Renmin University of China
Arbor 用持久假设树管理科研尝试,6 个 AO 任务 held-out 结果全胜,MLE-Bench Lite Any Medal 达 86.36%。
专家混合 · Renmin University of China
MPI 让 MoE 路由行对齐专家权重的主奇异方向。11B MoE 平均 benchmark 准确率从 40.92 升到 42.76,训练只慢 0.2%。
扩散语言模型 · Renmin University of China
LLaDA 用掩码扩散取代下一个词预测,8B 模型在上下文学习上与 LLaMA3 8B 持平,GSM8K 拿 70.7,反向补诗任务还反超 GPT-4o。
大模型推理 · Renmin University of China
DelTA 把 RLVR 更新重加权,让信用落在真正能区分对错的 token 上,使 Qwen3-8B-Base 平均提升 3.26 分、Qwen3-14B-Base 提升 2.62 分。
文本嵌入 · Renmin University of China
EmbFilter 把解嵌入矩阵当透镜,剥掉文本嵌入里被高频废词占据的子空间,在不微调的前提下提升零样本检索并降维。