HOList:高阶逻辑定理证明环境
HOList:高阶逻辑定理证明环境把面向高阶逻辑证明的机器学习落到具体方法和可检查结果上,适合判断该方向的真实进展。
主题
从 LeanDojo、miniF2F、DeepSeek-Prover 与 HOList 开始,按证明环境、评测条件与复现目标选择 AI 定理证明论文。
阅读 AI 定理证明论文,可以先选证明环境,再确定评测问题。本精选覆盖 Lean 前提检索、形式化数学基准、利用验证反馈的证明搜索与高阶逻辑。下面四篇入门论文按这些差异选择,不按分数排名,也不声称覆盖最新系统。
要搭建 Lean 证明器,先读 LeanDojo(2023)。它提供证明数据抽取和程序化交互工具,ReProver 先检索前提,再生成 tactic。发布的基准包含 98,734 条定理及证明。重点看 novel-premises 划分:依赖熟悉数学库前提的题目做得好,未必代表模型能处理训练时没用过的前提。
要比较形式化数学成绩,先读 miniF2F(2021)。它整理了来自竞赛及教学数学的 488 条形式化题目,并提供多个证明助手的版本。它是评测资源,不是证明器。比较论文百分比前,核对证明助手、验证集与测试集划分、可用 tactic 和尝试次数,不能只看题库名字相同。
要研究验证反馈如何用于训练和搜索,读 DeepSeek-Prover-V1.5(2024)。它将监督微调、强化学习和蒙特卡洛树搜索用于 Lean 4 证明生成。复现时把模型能力与搜索程序分开记录:大量尝试后找到证明,与单次生成成功,对部署成本的含义不同。保留搜索预算和验证环境,才能解释结果。
想比较另一套证明环境,读 HOList(2019)。它把 HOL Light 高阶逻辑证明整理成机器学习交互环境与基准,适合检查方法结论是否依赖 Lean 工具链。在 HOL Light 有效的方法,迁移到 Lean 后仍需验证;数学库、证明状态和动作空间都可能不同。
第一次做可复现实验,建议先用 miniF2F 理解评测约定,再用 LeanDojo 理解检索与环境接口,最后读 DeepSeek-Prover-V1.5 的反馈和搜索方案。比较证明助手生态时穿插阅读 HOList。下方解读均链接原论文,便于继续查实现和实验条件。
选系统前记录证明助手及版本、训练数据重叠、超时、尝试次数,以及最终证明是否由助手核验。这些是选择依据,不能压缩成一个通用排行榜。核验通过对应的是输入的形式化命题;形式化命题是否准确表达原本的数学问题,仍要单独检查。
HOList:高阶逻辑定理证明环境把面向高阶逻辑证明的机器学习落到具体方法和可检查结果上,适合判断该方向的真实进展。
AI 定理证明论文精选 · Princeton University
LeanDojo:检索增强定理证明把Lean 中的检索增强定理证明落到具体方法和可检查结果上,适合判断该方向的真实进展。
AI 定理证明论文精选 · Independent Researcher
MiniF2F:形式化奥赛数学基准把形式化奥赛级数学评测落到具体方法和可检查结果上,适合判断该方向的真实进展。
DeepSeek-Prover-V1.5 把 Lean 反馈、强化学习和 RMaxTS 搜索结合起来,miniF2F 达 63.5%,ProofNet 达 25.3%。
HOList:高阶逻辑定理证明环境把面向高阶逻辑证明的机器学习落到具体方法和可检查结果上,适合判断该方向的真实进展。
AI 定理证明论文精选 · Independent Researcher
MiniF2F:形式化奥赛数学基准把形式化奥赛级数学评测落到具体方法和可检查结果上,适合判断该方向的真实进展。
AI 定理证明论文精选 · Princeton University
LeanDojo:检索增强定理证明把Lean 中的检索增强定理证明落到具体方法和可检查结果上,适合判断该方向的真实进展。
AlphaGeometry 用语言模型加符号引擎,在 1 亿条合成定理上从零训练,30 道奥赛几何题解出 25 道,而此前最强方法只有 10 道。
MaxProof 把 MiniMax-M3 当作生成器、验证器、修复器和排序器使用,在 IMO 2025 得到 35/42,USAMO 2026 得到 36/42。
HOList:高阶逻辑定理证明环境把面向高阶逻辑证明的机器学习落到具体方法和可检查结果上,适合判断该方向的真实进展。
AI 定理证明论文精选 · Princeton University
LeanDojo:检索增强定理证明把Lean 中的检索增强定理证明落到具体方法和可检查结果上,适合判断该方向的真实进展。
AI 定理证明论文精选 · Independent Researcher
MiniF2F:形式化奥赛数学基准把形式化奥赛级数学评测落到具体方法和可检查结果上,适合判断该方向的真实进展。
这项工作把 AI 形式化证明搜索放到开放数学题上评测:最强 agent 解出 353 个 Erdos 问题中的 9 个,证明 492 个 OEIS 猜想中的 44 个。
DeepSeek-Prover-V1.5 把 Lean 反馈、强化学习和 RMaxTS 搜索结合起来,miniF2F 达 63.5%,ProofNet 达 25.3%。
MaxProof 把 MiniMax-M3 当作生成器、验证器、修复器和排序器使用,在 IMO 2025 得到 35/42,USAMO 2026 得到 36/42。
HOList:高阶逻辑定理证明环境把面向高阶逻辑证明的机器学习落到具体方法和可检查结果上,适合判断该方向的真实进展。
AI 定理证明论文精选 · Princeton University
LeanDojo:检索增强定理证明把Lean 中的检索增强定理证明落到具体方法和可检查结果上,适合判断该方向的真实进展。
AI 定理证明论文精选 · Independent Researcher
MiniF2F:形式化奥赛数学基准把形式化奥赛级数学评测落到具体方法和可检查结果上,适合判断该方向的真实进展。
这项工作把 AI 形式化证明搜索放到开放数学题上评测:最强 agent 解出 353 个 Erdos 问题中的 9 个,证明 492 个 OEIS 猜想中的 44 个。
DeepSeek-Prover-V1.5 把 Lean 反馈、强化学习和 RMaxTS 搜索结合起来,miniF2F 达 63.5%,ProofNet 达 25.3%。
AlphaGeometry 用语言模型加符号引擎,在 1 亿条合成定理上从零训练,30 道奥赛几何题解出 25 道,而此前最强方法只有 10 道。