发展趋势量子位5/10

小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅

By 鹭羽

小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅
图源:量子位

AI 摘要

中国大模型首次获得IMO官方金牌水平认证

原文正文

小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅

中国大模型首次获得IMO官方金牌水平认证

鹭羽 发自 凹非寺

量子位 | 公众号 QbitAI

哈?小红书你真是闷声干大事啊!

刚刚,IMO 2026成绩新鲜出炉,大模型交卷今年卷到了新高度。

结果第一个拿到官方评卷满分的居然是小红书???

经IMO官方评定,小红书大模型dots-note-3.0,六道题全部答对,以满分成绩斩获金牌。

含金量有多高呢?

这么说吧,这是中国大模型首次获得IMO官方金牌水平认证,也是继谷歌Gemini模型之后,全球第二个达到该成绩的大模型。

而且划重点!是满分!谷歌当年也只答对了5/6……

震惊了,这还是我印象中的小红书吗?

首次登上世界级竞赛,就来了场开门红~

再往下深扒,小红书大模型dots-note-3.0的解题方式也让人眼前一亮又一亮:

它仅用自然语言就完成了从读题、解析到写证明的全过程,最终答案不仅全部正确,在部分题目上还创新地提出了非常规解法。

双CMO金牌得主刘涵祚看完后这样评价:

模型最终给出了一条正确且漂亮的证明思路。

这种解法结构紧凑、逻辑自然,即使放在IMO解答中,也属于较为简洁优雅的一类。

CMO金牌得主汪千桐也给出了相似的结论:

从数学审美的角度看,小红书大模型dots-note-3.0的解答非常漂亮也很优雅。

常规解法已经很巧妙,但dots直接攻克了题目最难、也最本质的部分。

在他看来,dots解题简洁明了而且直击本质。

看完以后,会觉得每一步都顺理成章,但真正拿到题目时,人类选手很难想到能从这个角度切入。

换句话说,IMO满分金牌或许还远不是小红书大模型dots-note-3.0能力的上限。

为什么当前的大模型需要IMO

先来个科普,讲讲IMO究竟是什么,又为何各家都在争先送自家大模型上考场。

IMO又叫国际数学奥林匹克竞赛,每年全世界最顶尖的中学生云集于此。

陶哲轩等几乎半数当代菲尔兹奖得主都是从IMO出来的,谷歌联创Sergey Brin也拿过IMO金牌。

比赛一般分两天进行,每天4.5小时需要完成3道题,总计6道题,覆盖代数、组合、几何和数论四个方向。每题7分,满分42分。

但光有答案还不算数,参赛者要想拿分,必须写出逻辑完整、能接受逐步审查的证明过程。

这对大模型来说,难度极高,却也是最直观的能力展示途径。

以Gemini为例,2024年谷歌首次挑战IMO,最终只拿到28分的银牌水平,彼时系统也还需要先将自然语言题目翻译成Lean等形式化语言,部分题目耗时甚至长达数天。

第二年卷土重来,Gemini Deep Think直接以自然语言端到端完成证明,用4.5小时就解决了5道题,获得金牌。

这背后是一次跨代的能力跃迁。

往深了说,数学就是大模型智力与推理能力的试金石,大模型在IMO这类数学竞赛中走得越远,越能说明其底层优势。

再举个最近的例子,就在本周,Fable 5参与构造了一个雅可比猜想反例。

该猜想自1939年提出以来悬而未决长达87年,连张益唐等顶尖数学家都曾在此折戟。

这次找到的反例虽尚未经过正式同行评审,但也标志着大模型现阶段的能力足以参与真正的数学发现。

而数学竞赛,正是模型进入科研深水区之前,那道最硬核的能力门槛。

除此之外,IMO还有一个相比Benchmark得天独厚的优势——未知。

阅读原文
小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅 · AI Daily