聊聊AI的进展,从词语接龙到自己搞科研
从解小学数学题,到拿下国际奥赛金牌,再到独立证明困扰数学界几十年的猜想——AI 的"认知进化"速度,可能比你想象的快得多。
为什么从小学数学开始
早期的大语言模型(ChatGPT 那一类)本质上是统计概率的词预测机。你给它一句话,它根据统计概率猜下一个最可能的词。这对写文章管用,但你让它做逻辑推理呢?比如"一根绳子用厘米量是 30,那用分米量是多少?"——早期模型经常一本正经地胡说八道。
为什么?因为它缺了最底层的那块拼图:确定性逻辑。就是"1+1 必须等于 2"这种硬规则,而不是"大概等于 2"。人类小孩学数学也是这样进阶的:先学比大小,再学用尺子量,然后才是四则运算和单位换算。一步都跳不过。AI 也一样。
没有掌握基础逻辑,高级推理就无法开展。所以第一个转变必须是:从"概率词预测机"变成"逻辑推理引擎"。
深度研究:AI 学会自主调查
有了基础逻辑后,AI 做了更惊人的事——它学会了自主做研究。
2025 年 2 月,OpenAI 推出了"深度研究"功能。这不是你问我答的聊天模式,而是这样运作的:
- 先理清需求——提出澄清问题而非直接冲。
- 自我分解任务——把大问题拆成子问题树,先搭框架再填细节。
- 广泛搜索——在网上跑多轮查询,边搜边调整关键词,绕过付费墙,换思路应对无用结果。
- 深度分析——读网页、解析 PDF、看图表,甚至自己写 Python 代码。
- 生成报告——整理成有引用、逻辑清晰的完整报告。
实际上,30 分钟完成人类研究员 6-8 小时的工作。有专业人士盲评后说"比实习生写得好"。有建筑师用它生成 15000 字的建筑规范清单,综合了 21 个来源,省掉 15-20 小时手工活。
系统有硬性限制——搜索次数、运行时间、迭代次数上限。到了上限还没完成?就提交"阶段报告",不会装作全部查到了。
Google 的另一条路
Google 的 Gemini 深度研究走的是另一条路:深度融入企业基础设施。
OpenAI 的深度研究在公开互联网上刨数据,Gemini 能直接翻你的 Gmail、Drive、Docs、Sheets 和团队聊天。做竞争分析时,它一边抓公开的市场数据,一边翻公司内部的战略备忘录和产品对比表,然后合成跨越公共信息和内部情报的报告。
实际上,以前需要团队花好几天的分析工作,现在一个提示词搞定。新员工快速上手项目?Gemini 帮你扒邮件、文档和聊天记录,五分钟出项目梗概。
两条路线的对比
- OpenAI:逻辑能力强的独立调查者,擅长在公开信息里深挖,适合需要硬核推演和大规模数据计算的场景。
- Google:深度融入企业的超级助理,擅长把内部知识和外部情报无缝接合,适合企业和学术场景。
在"人类最后考试"(HLE)这个极难的多学科推理基准上的成绩:OpenAI 拿了 26.6%,Google 后来达到 46.4%。这些数字低是因为测试本身就是设计来考验 AI 极限的。
从综合到创造:AI 开始证明数学定理
深度研究再厉害,本质上还是在整理和综合人类的知识。
接下来的事性质完全不同——AI 开始创造新知识。
怎么检验 AI 是否真的"会思考"而不是在背答案?数学界给出了最严苛的考场:让它证明定理。在纯数学世界里,背再多训练数据也没用,只有逻辑推演才能通关。
AlphaGeometry:神经网络与符号推理的结合
Google DeepMind 搞了一个 AlphaGeometry 系统,专攻国际数学奥林匹克(IMO)级别的几何题。它的架构巧妙地结合了两套推理系统:
- 神经网络(直觉):提出候选动作——"如果我在这里加条辅助线呢?"就像数学家的灵光一现。
- 符号推理器(严谨):逐步验证每一步,绝不放过漏洞。
两者交替:符号推理器尽力推进,卡住了就交给神经网络添加辅助构造,符号推理器继续。反复循环直到找到证明。
成绩很说明问题。AlphaGeometry 30 道 IMO 几何题解了 25 道,之前最好的方法只能解 10 道。它甚至发现了一个 2004 年 IMO 定理的更一般化版本——相当于自己"发明"了新定理。
2025 年 7 月:AI 拿下 IMO 金牌
2025 年 7 月,Google DeepMind 宣布搭载"深度思考"功能的 Gemini 在 IMO 达到了金牌水平:42 分拿了 35 分,6 题完美解了 5 题,涵盖代数、组合、几何、数论。
IMO 主席和协调员按照对人类选手的同样标准进行了独立评阅,评价是"令人惊叹"、"清晰"、"精确"。
这次突破有一个本质区别。以前的系统需要人类专家花好几天把题目手动翻译成形式化语言,AI 才能开始。这次,Gemini 直接读题目原文,在 4.5 小时正式赛时内自主写出完整证明——完全端到端,不需要人类翻译。
怎么做到的?DeepMind 把成功归因于三个策略:
- 并行探索:不走单一路线,同时探索多条解题路径,像多核 CPU 一样并行验证不同假设。
- 深度强化学习:在海量数学推理数据上训练,学会了在漫长推理链中坚持不放弃。
- 专家知识库:喂给模型精选的高质量数学解答和技巧,教它"像顶级数学家一样思考"。
但它在最难的第 6 题上得了零分。需要天才灵感的极限前沿,AI 仍有明显盲区。
Aletheia:自主数学研究
IMO 金牌很牛,但奥赛题毕竟是"设计好的谜题"——保证有答案,知识范围也有限。
真正的数学研究完全是另一回事:问题不一定有解,要在浩如烟海的文献里找方向,构建跨越多个领域的证明,在完全未知的空间里探索。
为了攻克这个难题,DeepMind 建造了 Aletheia——名字来自希腊语的"真理"女神。这不是解题器,而是完整的自主数学研究代理。
700 道未解问题的检验
2025 年 12 月,Aletheia 面对了 Bloom 的 Erdős 问题数据库中 700 个至今未被人类解决的数论和组合几何猜想。
- Aletheia 甄别出 212 个它认为已经解决的。
- 人类初步检查后留下 63 个看起来可信的。
- 专家最终确认:13 个正确解决。
这 13 个突破分成四类:
完全自主解决(2 个)——真正的创造。Erdős-1051 是学术界公认的重量级里程碑:Aletheia 巧妙地把不同理论框架的工具串联起来,彻底解决了困扰数学界几十年的问题。
部分攻克(2 个)——成功解决包含多个子问题的复杂猜想中的关键部分。
独立重新发现(4 个)——从零开始纯靠逻辑推出完美证明,后来发现这些证明其实已存在于某些极其冷门的文献里。AI 用纯推理"重新发明了轮子",思路和顶级数学家完全平行。
文献纠错(5 个)——这些所谓"未解问题"其实早就被别人解过,数据库只是标记错了。相当于帮学术界做了大扫除。
更吓人的:FirstProof 挑战赛
Aletheia 还参加了首届 FirstProof 挑战赛,面对 10 道连人类学者都没达成共识的前沿问题,自主解决了 6 道(第 2、5、7、8、9、10 题)。
有趣的是,第 8 题,连人类专家评委自己都吵起来了,对 AI 的解答意见严重分歧。这说明什么?AI 的推理在某些维度上已经触及甚至超越了部分人类专家的理解边界。
AI 当上论文第一作者
前面说的都是"解题",接下来这件事才是真正的分水岭——AI 自主写出了可以发表的学术论文。
代号"Feng26"的论文由 Aletheia 在完全没有人类指导的情况下自主生成。它深入算术几何这个极其抽象的领域,自主发现了研究空白,执行了底层计算,设计了新证明,最后自己写成了符合学术规范的论文。
从发现问题到完成论文,全程零人类干预。
更现实的模式是人机协作。论文"LeeSeo26",人类研究员和 Aletheia 联手攻克了关于相互作用粒子系统的复杂问题——AI 充当假设生成器和逻辑验证引擎,人类提供物理直觉和大方向。
还有"BKK+26"论文,起因是 Aletheia 自主搞定了 Erdős-1051 猜想。数学家们觉得这个证明方法妙极了,于是和 AI 合作把它推广成更普遍的定理。
但也有真实的风险
成功故事重要,但诚实的风险评估同样关键。
隐性记忆的风险
AI 在预训练时吞了海量数据。谁能保证它"证明"出的东西不是从某个角落隐性记忆出来的?Aletheia 论文的作者们直接讨论了这个问题:通过审查推理轨迹,他们确认某些解法确实是内部推理而非直接检索。但这种甄别机制远不够成熟。学术界需要更系统的审计工具来区分"真正的新证明"和"高级复制粘贴"。
人类语言太模糊
Aletheia 在处理一些猜想时频繁卡壳,原因是——人类数学家写问题时太随意了,省略太多上下文,用了一堆约定俗成的说法,AI 的逻辑引擎理解不了。最后还得人类专家当翻译。
谁的功劳
当 AI 参与了科研成果,知识产权怎么算?目前的做法是采用"人类+系统名称"的联合署名,并在方法部分详细披露 AI 在各环节的参与程度。学术界也在呼吁建立更细化的"AI 贡献等级"分类标准。
超越数学
同样的底层能力——海量数据处理、严密逻辑推理、自主假设验证——正在改变其他领域:
- 基因组学:DeepMind 的 AlphaMissense 对数百万种潜在点突变进行致病性评分,帮助筛查罕见遗传病的病因。AlphaGenome 能在不到一秒内评估基因突变对各种分子属性的影响。
- 地球科学:AlphaEarth Foundations 把卫星、雷达和激光雷达的数据融合成统一高维表示,以约 10×10 米的分辨率测绘全球陆地和近海,加速生态分类和环境变化分析。
- 天气预报:WeatherNext 用 AI 替代传统超算模型,推理速度快约 8 倍,能在同等时间内评估更多情景,提高对极端天气的捕捉能力。
每一个都遵循着 Aletheia 的进化主线:自主摄取数据、严密逻辑分析、生成超越人类处理能力的科学结论。
这条轨迹
回头看这条路:
学会基础逻辑 → 学会自主查资料写报告 → 学会证明数学定理 → 学会独立做科研发论文
这就是一个人从小学到博士后的成长轨迹。AI 用了几年走完了人类几十年的路。
未来大概是这样:人类负责提出充满直觉跳跃的"大问题",设定探索方向和伦理边界;AI 负责扫清技术障碍,不知疲倦地计算、推理、验证。
人类不再需要花大量时间在数据清洗、文献比对、中间推导这些苦力活上。我们的角色变成了那支超级 AI 研究团队的战略指挥官。
延伸阅读 & 参考资料
深度研究
- OpenAI Deep Research 官方介绍
- Deep Research 工作机制详解 — PromptLayer
- 实测报告:"我们试了 OpenAI 的深度研究" — Every
- Gemini Deep Research 企业集成 — Google Blog
- Gemini Deep Research 使用指南 — Skywork
- Gemini 在 HLE 上达到 46.4% — LinkedIn
数学推理 & 定理证明
- AlphaGeometry 论文 — Nature
- AlphaGeometry 社区讨论 — Reddit
- Gemini Deep Think 达到 IMO 金牌水平 — DeepMind 官方博客
- ChatGPT 和 Gemini 的 IMO 表现对比 — Champaign Magazine
Aletheia & 自主数学研究
- Aletheia 代理架构 — arXiv 2602.21201
- Erdős 猜想实验 — arXiv 2601.22401(PDF)
- AI 论文成果 Feng26 / LeeSeo26 — arXiv 2601.21442
- FirstProof 挑战赛 — ChatPaper
- BKK+26 讨论 — Reddit r/singularity
跨学科科学应用