文章 · 2026-02-25

聊聊AI的进展,从词语接龙到自己搞科研

从解小学数学题,到拿下国际奥赛金牌,再到独立证明困扰数学界几十年的猜想——AI 的"认知进化"速度,可能比你想象的快得多。


为什么从小学数学开始

早期的大语言模型(ChatGPT 那一类)本质上是统计概率的词预测机。你给它一句话,它根据统计概率猜下一个最可能的词。这对写文章管用,但你让它做逻辑推理呢?比如"一根绳子用厘米量是 30,那用分米量是多少?"——早期模型经常一本正经地胡说八道。

为什么?因为它缺了最底层的那块拼图:确定性逻辑。就是"1+1 必须等于 2"这种硬规则,而不是"大概等于 2"。人类小孩学数学也是这样进阶的:先学比大小,再学用尺子量,然后才是四则运算和单位换算。一步都跳不过。AI 也一样。

没有掌握基础逻辑,高级推理就无法开展。所以第一个转变必须是:从"概率词预测机"变成"逻辑推理引擎"。


深度研究:AI 学会自主调查

有了基础逻辑后,AI 做了更惊人的事——它学会了自主做研究

2025 年 2 月,OpenAI 推出了"深度研究"功能。这不是你问我答的聊天模式,而是这样运作的

  1. 先理清需求——提出澄清问题而非直接冲。
  2. 自我分解任务——把大问题拆成子问题树,先搭框架再填细节。
  3. 广泛搜索——在网上跑多轮查询,边搜边调整关键词,绕过付费墙,换思路应对无用结果。
  4. 深度分析——读网页、解析 PDF、看图表,甚至自己写 Python 代码。
  5. 生成报告——整理成有引用、逻辑清晰的完整报告。

实际上,30 分钟完成人类研究员 6-8 小时的工作。有专业人士盲评后说"比实习生写得好"。有建筑师用它生成 15000 字的建筑规范清单,综合了 21 个来源,省掉 15-20 小时手工活。

系统有硬性限制——搜索次数、运行时间、迭代次数上限。到了上限还没完成?就提交"阶段报告",不会装作全部查到了。

Google 的另一条路

Google 的 Gemini 深度研究走的是另一条路:深度融入企业基础设施。

OpenAI 的深度研究在公开互联网上刨数据,Gemini 能直接翻你的 Gmail、Drive、Docs、Sheets 和团队聊天。做竞争分析时,它一边抓公开的市场数据,一边翻公司内部的战略备忘录和产品对比表,然后合成跨越公共信息和内部情报的报告。

实际上,以前需要团队花好几天的分析工作,现在一个提示词搞定。新员工快速上手项目?Gemini 帮你扒邮件、文档和聊天记录,五分钟出项目梗概。

两条路线的对比

在"人类最后考试"(HLE)这个极难的多学科推理基准上的成绩:OpenAI 拿了 26.6%,Google 后来达到 46.4%。这些数字低是因为测试本身就是设计来考验 AI 极限的。


从综合到创造:AI 开始证明数学定理

深度研究再厉害,本质上还是在整理和综合人类的知识

接下来的事性质完全不同——AI 开始创造新知识

怎么检验 AI 是否真的"会思考"而不是在背答案?数学界给出了最严苛的考场:让它证明定理。在纯数学世界里,背再多训练数据也没用,只有逻辑推演才能通关。

AlphaGeometry:神经网络与符号推理的结合

Google DeepMind 搞了一个 AlphaGeometry 系统,专攻国际数学奥林匹克(IMO)级别的几何题。它的架构巧妙地结合了两套推理系统

两者交替:符号推理器尽力推进,卡住了就交给神经网络添加辅助构造,符号推理器继续。反复循环直到找到证明。

成绩很说明问题。AlphaGeometry 30 道 IMO 几何题解了 25 道,之前最好的方法只能解 10 道。它甚至发现了一个 2004 年 IMO 定理的更一般化版本——相当于自己"发明"了新定理。

2025 年 7 月:AI 拿下 IMO 金牌

2025 年 7 月,Google DeepMind 宣布搭载"深度思考"功能的 Gemini 在 IMO 达到了金牌水平:42 分拿了 35 分,6 题完美解了 5 题,涵盖代数、组合、几何、数论。

IMO 主席和协调员按照对人类选手的同样标准进行了独立评阅,评价是"令人惊叹"、"清晰"、"精确"。

这次突破有一个本质区别。以前的系统需要人类专家花好几天把题目手动翻译成形式化语言,AI 才能开始。这次,Gemini 直接读题目原文,在 4.5 小时正式赛时内自主写出完整证明——完全端到端,不需要人类翻译

怎么做到的?DeepMind 把成功归因于三个策略

但它在最难的第 6 题上得了零分。需要天才灵感的极限前沿,AI 仍有明显盲区。


Aletheia:自主数学研究

IMO 金牌很牛,但奥赛题毕竟是"设计好的谜题"——保证有答案,知识范围也有限。

真正的数学研究完全是另一回事:问题不一定有解,要在浩如烟海的文献里找方向,构建跨越多个领域的证明,在完全未知的空间里探索。

为了攻克这个难题,DeepMind 建造了 Aletheia——名字来自希腊语的"真理"女神。这不是解题器,而是完整的自主数学研究代理

700 道未解问题的检验

2025 年 12 月,Aletheia 面对了 Bloom 的 Erdős 问题数据库中 700 个至今未被人类解决的数论和组合几何猜想。

结果如何?

这 13 个突破分成四类

完全自主解决(2 个)——真正的创造。Erdős-1051 是学术界公认的重量级里程碑:Aletheia 巧妙地把不同理论框架的工具串联起来,彻底解决了困扰数学界几十年的问题。

部分攻克(2 个)——成功解决包含多个子问题的复杂猜想中的关键部分。

独立重新发现(4 个)——从零开始纯靠逻辑推出完美证明,后来发现这些证明其实已存在于某些极其冷门的文献里。AI 用纯推理"重新发明了轮子",思路和顶级数学家完全平行。

文献纠错(5 个)——这些所谓"未解问题"其实早就被别人解过,数据库只是标记错了。相当于帮学术界做了大扫除。

更吓人的:FirstProof 挑战赛

Aletheia 还参加了首届 FirstProof 挑战赛,面对 10 道连人类学者都没达成共识的前沿问题,自主解决了 6 道(第 2、5、7、8、9、10 题)。

有趣的是,第 8 题,连人类专家评委自己都吵起来了,对 AI 的解答意见严重分歧。这说明什么?AI 的推理在某些维度上已经触及甚至超越了部分人类专家的理解边界。


AI 当上论文第一作者

前面说的都是"解题",接下来这件事才是真正的分水岭——AI 自主写出了可以发表的学术论文

代号"Feng26"的论文由 Aletheia 在完全没有人类指导的情况下自主生成。它深入算术几何这个极其抽象的领域,自主发现了研究空白,执行了底层计算,设计了新证明,最后自己写成了符合学术规范的论文。

从发现问题到完成论文,全程零人类干预。

更现实的模式是人机协作。论文"LeeSeo26",人类研究员和 Aletheia 联手攻克了关于相互作用粒子系统的复杂问题——AI 充当假设生成器和逻辑验证引擎,人类提供物理直觉和大方向。

还有"BKK+26"论文,起因是 Aletheia 自主搞定了 Erdős-1051 猜想。数学家们觉得这个证明方法妙极了,于是和 AI 合作把它推广成更普遍的定理。


但也有真实的风险

成功故事重要,但诚实的风险评估同样关键。

隐性记忆的风险

AI 在预训练时吞了海量数据。谁能保证它"证明"出的东西不是从某个角落隐性记忆出来的?Aletheia 论文的作者们直接讨论了这个问题:通过审查推理轨迹,他们确认某些解法确实是内部推理而非直接检索。但这种甄别机制远不够成熟。学术界需要更系统的审计工具来区分"真正的新证明"和"高级复制粘贴"。

人类语言太模糊

Aletheia 在处理一些猜想时频繁卡壳,原因是——人类数学家写问题时太随意了,省略太多上下文,用了一堆约定俗成的说法,AI 的逻辑引擎理解不了。最后还得人类专家当翻译。

谁的功劳

当 AI 参与了科研成果,知识产权怎么算?目前的做法是采用"人类+系统名称"的联合署名,并在方法部分详细披露 AI 在各环节的参与程度。学术界也在呼吁建立更细化的"AI 贡献等级"分类标准。


超越数学

同样的底层能力——海量数据处理、严密逻辑推理、自主假设验证——正在改变其他领域:

每一个都遵循着 Aletheia 的进化主线:自主摄取数据、严密逻辑分析、生成超越人类处理能力的科学结论。


这条轨迹

回头看这条路:

学会基础逻辑 → 学会自主查资料写报告 → 学会证明数学定理 → 学会独立做科研发论文

这就是一个人从小学到博士后的成长轨迹。AI 用了几年走完了人类几十年的路。

未来大概是这样:人类负责提出充满直觉跳跃的"大问题",设定探索方向和伦理边界;AI 负责扫清技术障碍,不知疲倦地计算、推理、验证。

人类不再需要花大量时间在数据清洗、文献比对、中间推导这些苦力活上。我们的角色变成了那支超级 AI 研究团队的战略指挥官


延伸阅读 & 参考资料

深度研究

数学推理 & 定理证明

Aletheia & 自主数学研究

跨学科科学应用

© 2026 Yuxu Ge ·