小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅
By 鹭羽

AI 摘要
中国大模型首次获得IMO官方金牌水平认证
原文正文
小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅
中国大模型首次获得IMO官方金牌水平认证
鹭羽 发自 凹非寺
量子位 | 公众号 QbitAI
哈?小红书你真是闷声干大事啊!
刚刚,IMO 2026成绩新鲜出炉,大模型交卷今年卷到了新高度。
结果第一个拿到官方评卷满分的居然是小红书???
经IMO官方评定,小红书大模型dots-note-3.0,六道题全部答对,以满分成绩斩获金牌。
含金量有多高呢?
这么说吧,这是中国大模型首次获得IMO官方金牌水平认证,也是继谷歌Gemini模型之后,全球第二个达到该成绩的大模型。
而且划重点!是满分!谷歌当年也只答对了5/6……
震惊了,这还是我印象中的小红书吗?
首次登上世界级竞赛,就来了场开门红~
再往下深扒,小红书大模型dots-note-3.0的解题方式也让人眼前一亮又一亮:
它仅用自然语言就完成了从读题、解析到写证明的全过程,最终答案不仅全部正确,在部分题目上还创新地提出了非常规解法。
双CMO金牌得主刘涵祚看完后这样评价:
模型最终给出了一条正确且漂亮的证明思路。
这种解法结构紧凑、逻辑自然,即使放在IMO解答中,也属于较为简洁优雅的一类。
CMO金牌得主汪千桐也给出了相似的结论:
从数学审美的角度看,小红书大模型dots-note-3.0的解答非常漂亮也很优雅。
常规解法已经很巧妙,但dots直接攻克了题目最难、也最本质的部分。
在他看来,dots解题简洁明了而且直击本质。
看完以后,会觉得每一步都顺理成章,但真正拿到题目时,人类选手很难想到能从这个角度切入。
换句话说,IMO满分金牌或许还远不是小红书大模型dots-note-3.0能力的上限。
为什么当前的大模型需要IMO
先来个科普,讲讲IMO究竟是什么,又为何各家都在争先送自家大模型上考场。
IMO又叫国际数学奥林匹克竞赛,每年全世界最顶尖的中学生云集于此。
陶哲轩等几乎半数当代菲尔兹奖得主都是从IMO出来的,谷歌联创Sergey Brin也拿过IMO金牌。
比赛一般分两天进行,每天4.5小时需要完成3道题,总计6道题,覆盖代数、组合、几何和数论四个方向。每题7分,满分42分。
但光有答案还不算数,参赛者要想拿分,必须写出逻辑完整、能接受逐步审查的证明过程。
这对大模型来说,难度极高,却也是最直观的能力展示途径。
以Gemini为例,2024年谷歌首次挑战IMO,最终只拿到28分的银牌水平,彼时系统也还需要先将自然语言题目翻译成Lean等形式化语言,部分题目耗时甚至长达数天。
第二年卷土重来,Gemini Deep Think直接以自然语言端到端完成证明,用4.5小时就解决了5道题,获得金牌。
这背后是一次跨代的能力跃迁。
往深了说,数学就是大模型智力与推理能力的试金石,大模型在IMO这类数学竞赛中走得越远,越能说明其底层优势。
再举个最近的例子,就在本周,Fable 5参与构造了一个雅可比猜想反例。
该猜想自1939年提出以来悬而未决长达87年,连张益唐等顶尖数学家都曾在此折戟。
这次找到的反例虽尚未经过正式同行评审,但也标志着大模型现阶段的能力足以参与真正的数学发现。
而数学竞赛,正是模型进入科研深水区之前,那道最硬核的能力门槛。
除此之外,IMO还有一个相比Benchmark得天独厚的优势——未知。