返回探索
资讯VibeFix 编辑部更新于 2026年10月7日

722 篇手稿一夜公开:AI 数学的「工业化时刻」,但信任还没跟上

10 月 6 日,OpenAI 把 722 篇 AI 生成的数学手稿放进公开 GitHub 仓库。平均每篇耗费约 3 小时推理算力,部分附带 Lean 形式化验证。数学家反应两极:这是数学的工业化时刻,也是学科信任机制被迫重写的时刻。

一位白发教授背对镜头,站在写满数学公式和几何图形的黑板前书写。

10 月 6 日发生了什么

2026 年 10 月 6 日,OpenAI 把一个 GitHub 仓库推到了公众面前:openai/math。里面装着 722 篇数学手稿,按主题归为 372 个相关结果家族。OpenAI 的说法是,这些手稿全部由一个尚未公开发布的内部模型生成。

数字值得细看。OpenAI 称,每个结果平均耗费了约 3 小时的 ChatGPT Pro 级别推理算力。评测期间,模型一共尝试了大约 4000 道数学题。换句话说,这是第一次有人把「AI 做数学」这件事,做到了可以用「篇数」和「算力账本」来衡量的规模。

公开的不止手稿。部分证明附带了 Lean 形式化验证——注意,是「部分」,不是全部。OpenAI 还公布了其中 10 个结果的推理摘要和算力统计。但有两样东西没给:提示词没有公开,模型也没有名字。

372 个「相关结果家族」这个组织方式本身就有信息量。OpenAI 没有把 722 篇手稿当成 722 个孤立成果来发布,而是按主题聚类。这说明模型的工作方式更接近「围绕一个数学方向系统性开题」,而不是随机撒网碰运气。对评估者来说,这也更友好:你可以挑自己熟悉的家族进去看,而不是在 722 篇里大海捞针。

另一个值得注意的数字是 4000。评测期间模型尝试了约 4000 道题,最终沉淀为 722 篇手稿、372 个家族。这个「尝试—沉淀」比例本身,就是一张成绩单:它告诉你这个模型的命中率大概在什么量级。OpenAI 没有公布 4000 道题的完整清单,这是透明度上的一块缺口——AGMAI 指南里「停止秘密基准测试」的要求,针对的正是这类操作。

还有 10 个结果的推理摘要和算力统计。这是整批发布里最「可读」的部分:你能看到模型是怎么一步步想的,每一步烧了多少算力。对于想复现、想学习、想挑毛病的人来说,这 10 个样本的价值可能超过剩下的 712 篇手稿。问题是:为什么只给 10 个?是成本太高,还是效果参差不敢全给?OpenAI 没说。

先说清楚:这不是「黎曼猜想被证明」

有些自媒体的标题已经写成了「AI 证明黎曼猜想」。这是错的。722 篇手稿里,没有任何一篇声称解决了黎曼猜想这类千禧年难题。把「工业化生产数学证明」和「证明最难的猜想」混为一谈,是在拿错误的故事盖过真正的故事。

真正的故事反而更大。按 OpenAI 此前披露的时间线:这个内部模型 2026 年 8 月 28 日开始训练,9 月 21 日 OpenAI 宣布它已解决 100 多个长期悬而未决的数学问题。两个月内,数学成果的生产方式从「手工作坊」被推向了「流水线」。问题不再是「AI 能不能做数学」,而是「AI 批量做出来的数学,人类还看得懂、信得过吗」。

这种误报不是偶然。AI 新闻的传播链条里,「模型做了 X」很容易在转发中滑向「模型攻克了人类最难的 X」。9 月 21 日 OpenAI 宣布「解决 100 多个长期悬而未决问题」时,同样的滑坡已经发生过一次:一些报道把「长期悬而未决」自动脑补成了「千禧年难题」。读者要养成一个习惯:看到 AI 数学的新闻,先问「解决的是哪类问题」,再问「证据链是什么」。这次证据链是公开的仓库,你可以自己点进去看——这恰恰是 OpenAI 这次做得对的地方。

数学家的反应:两极

多伦多大学的数学家 Daniel Litt 公开表示,这是 a good thing for math(对数学是好事)。他的逻辑不难理解:数学界长期缺人手验证、缺算力探索,多一个强大的证明机器,怎么看都是增量。

但更多数学家的第一反应是:拿出证据来。质疑集中在三点。第一,模型没有名字,提示词没有公开,别人没法复现,只能信 OpenAI 的一家之言。第二,722 篇手稿的证明,人类数学家逐篇验算的工作量大到不现实;只有部分证明有 Lean 形式化验证,大部分没有。第二层之外还有更深的一层:如果一个证明长到、复杂到没有人能真正理解,它还算「数学」吗?数学传统上要求证明是可被人类理解和检验的论证,而不只是一个「大概率对」的输出。

Hacker News 上,这场讨论盖起了长楼。支持者和怀疑者吵的其实是同一个问题:当证明的规模超过人类的阅读能力,数学的信任机制要靠什么重建。

还有一个更实际的层面:谁来审稿?传统数学论文走同行评审,一篇论文两三个审稿人看几个月。722 篇手稿,就算每篇只看一周,也需要十几个全职数学家干上一年。学术期刊的审稿体系是为「慢科学」设计的,根本接不住这种「批量到货」。要么期刊扩容审稿流程,要么学界接受「机器预审 + 人类抽查」的新流程——无论哪种,都是制度层面的大手术。

乐观派还有一个论据值得认真对待:数学史上,每次工具革命都先被质疑「这不是真正的数学」。计算机辅助证明刚出现时,四色定理的证明就因为「人类无法逐行验证」吵过一轮;后来 Lean、Coq 这些证明助手出现时,同样有人说「机器检查的证明没有灵魂」。历史的经验是:工具赢了,定义被改写了。这次可能也不例外。

普林斯顿的「新规则」:AGMAI 指南

有意思的是,就在 OpenAI 公开手稿的一周前,9 月 29 日,设在普林斯顿高等研究院、独立于 OpenAI 的「数学与 AI 咨询组」(AGMAI)发布了一份 AI 生成数学成果发布的负责任指南。这份指南是在 600 多份问卷调查之后形成的,针对的正是眼下这个局面。

指南的要求很具体:实验室应该停止秘密基准测试;给模型具名;公开提示词、推理摘要和算力成本;不要把数学成果当作模型的营销材料。

拿这把尺子量一下 OpenAI 这次的发布:推理摘要给了(10 个结果的),算力统计给了(平均每个结果约 3 小时 Pro 级推理),仓库公开了,秘密基准测试的问题部分回应了。但模型依然没有名字,提示词依然没有公开。用 AGMAI 的标准看,这是一次「交了一半答卷」的发布。

这份指南的真正分量在于,它是数学界第一次试图为「AI 做数学」这个新物种立法。过去数学论文的规范——同行评审、引用、署名——都是为人类作者设计的。现在作者栏里站进了一个不具名的模型,旧规则不够用了。

600 多份问卷这个数字也值得品味。AGMAI 没有关起门来写规则,而是先做了大规模调研。这说明数学界内部对「AI 生成成果该怎么发」本来就有分歧,指南是分歧的调和产物,不是某个学派的檄文。这种「先调研、再立法」的路子,恰恰是 OpenAI 这次发布最缺的东西:722 篇手稿是单方面公开的,规则是发布之后才被拿出来量的。顺序反了。

还有一个细节:「不要把数学成果当作模型的营销材料」。这句话几乎是点名式的。9 月 21 日 OpenAI 宣布「解决 100+ 悬而未决问题」时,模型没名字、没论文、没代码,只有新闻稿——典型的营销式发布。这次 10 月 6 日好歹给了仓库和部分验证,算是往前走了一步。AGMAI 的指南像一面镜子,照出了两次发布之间的进步,也照出了还没走完的路。

关键变量:Lean,和「机器可验证」这条路

722 篇手稿里最值得盯的细节,不是数量,而是 Lean。部分证明附带了 Lean 形式化验证。这意味着这些证明不只是「看起来对」,而是被一台机器从头到尾检查过逻辑链条。

这指向一种新的信任分工:人类负责提出问题、判断方向和品味,机器负责生成证明,另一台机器(证明检查器)负责验证。验证不再依赖「某个权威数学家看过并点头」,而是依赖「Lean 说通过了」。

这对 vibe coding 的人应该很熟悉。Agent 写出来的代码,你敢直接上线吗?不敢。但如果它附带一套能跑通的测试,或者更进一步——形式化验证——信任问题就换了一种解法:你不需要信任 Agent,你只需要信任检查器。「生成 + 机器可验证」,可能是 AI 时代所有高风险生成任务的通用答案:代码是这样,数学证明也是这样。

当然,Lean 验证只覆盖了部分手稿。剩下的几百篇,验证工作还得靠人,或者靠下一代验证工具。这是 OpenAI 留下的最大悬念,也是整个学界接下来几个月要啃的硬骨头。

往深想一层,「生成 + 机器可验证」这个模式,解决的不只是信任问题,还有成本问题。人类验证一篇长证明可能要几周,Lean 跑一遍只要几分钟(机器时间)。当生成侧的成本被推理算力打下来、验证侧的成本被形式化工具打下来,数学证明就第一次具备了「规模化生产」的两个条件:便宜的生成,便宜的验证。722 篇手稿就是这两个条件同时成立后的第一个样本。

反过来想:如果只有生成、没有验证,会发生什么?答案是「证明通胀」:仓库里堆满没人看得懂、没人验证过的证明,数学文献变成 AI 输出的垃圾场。这不是危言耸听——代码世界已经演过一遍了:Copilot 时代初期,大量「能跑但没人敢保证对」的代码流入仓库,团队被迫补测试、补 review 流程。数学界现在站在同样的岔路口,Lean 就是它的「测试流程」。

接下来看什么

三个问题决定这件事的最终分量。第一,独立验证:有没有第三方团队能复现其中一部分结果,或者用 Lean 把更多证明走完?第二,模型具名和提示词公开:OpenAI 会不会回应 AGMAI 指南的要求,把「交了一半的答卷」补完?第三,数学界的规范:期刊和会议会不会开始要求 AI 生成的证明必须附带机器可验证的版本?

对普通读者来说,还有一个更近的看点:openai/math 仓库是公开的,explainx.ai 从 10 月 6 日起在连载仓库解析。不用等期刊,不用等新闻稿,你可以直接点进去,看 AI 是怎么写数学的——这种「第一手围观」本身,就是这个时代的新鲜事。

722 这个数字本身,两年后可能没人记得。但它标志的转折会留下:数学第一次被「工业化生产」,而学科的信任机制,被迫在众目睽睽之下重写。这对做 AI 的人是个提醒——当你的模型开始批量产出人类看不懂的东西,「可验证性」不是可选项,是入场券。

原始来源

浏览项目广场发布你的项目

相关文章

深色背景上的麦克风与声波纹理,象征微软新发布的实时语音 AI 模型
资讯
0.13 秒听完、0.15 秒开口:微软语音三件套补齐语音 Agent 的最后一块拼图

2026 年 10 月 1 日,微软 AI 一次发布三个语音模型:MAI-Transcribe-2-Streaming(流式转写,Artificial Analysis 流式榜准确率第一,2.5% 词错率、说话结束 0.13 秒出终稿)、MAI-Voice-2.1(23 语言同音色跨语言)与 2.1-Flash(45 秒音频、端到端 150ms)。听、说两端凑齐,纯微软技术栈的语音 Agent 一轮对话可以压进 1 秒内。

模型动态产品动态AI 智能体
Google Cloud 发布会舞台,大屏幕上展示 Gemini agent 发布主题
资讯
给 Agent 发工牌、邮箱和通讯录席位:Google Cloud 发布统一工作 Agent,按任务在 Gemini 和 Claude 之间选模型

2026 年 10 月 8 日,Google Cloud 在 Gemini at Work 2026 大会上发布 Gemini agent:为工作而生的统一 Agent,拿目标自己规划、按任务在 Gemini 和 Claude 模型之间自动选择,并推出拥有独立邮箱、calendar 和通讯录席位的「同事 Agent」。四点判断:Agent 竞赛的下半场是「更像同事的 Agent」。

产品发布AI 编程实践自动化
屏幕上显示代码与 Cyber Attack、Data Breach 字样的网络安全主题照片,象征 agent 将漏洞描述武器化的新威胁
资讯
「披露即武器化」:coding agent 把 CVE 描述变成 exploit 的成功率达 87%,协调披露的老规矩正在失效

InfoQ 10 月 3 日报道:拿到 CVE 描述的 GPT-4 agent 在基准测试中成功利用了 15 个测试漏洞中的 87%,而没有描述时只有 7%。rclone 作者最近一个月收到 40 多份安全披露,超过项目前十年总和;QEMU 已经缩短 embargo 期。漏洞披露的时间线正在被 agent 压缩坍塌。

安全与隐私行业趋势AI 编程实践