鹭羽 发自 凹非寺

  量子位 | 公众号 QbitAI

  哈?小红书你真是闷声干大事啊!

  刚刚,IMO 2026成绩新鲜出炉,大模型交卷今年卷到了新高度。

  结果第一个拿到官方评卷满分的居然是小红书???

  经IMO官方评定,小红书大模型dots-note-3.0,六道题全部答对,以满分成绩斩获金牌。

  含金量有多高呢?

  这么说吧,这是中国大模型首次获得IMO官方金牌水平认证,也是继谷歌Gemini模型之后,全球第二个达到该成绩的大模型。

  而且划重点!是满分!谷歌当年也只答对了5/6……

  震惊了,这还是我印象中的小红书吗?

  首次登上世界级竞赛,就来了场开门红~

  再往下深扒,小红书大模型dots-note-3.0的解题方式也让人眼前一亮又一亮:

  它仅用自然语言就完成了从读题、解析到写证明的全过程,最终答案不仅全部正确,在部分题目上还创新地提出了非常规解法。

  △图片由AI生成

  双CMO金牌得主刘涵祚看完后这样评价:

  模型最终给出了一条正确且漂亮的证明思路。

  这种解法结构紧凑、逻辑自然,即使放在IMO解答中,也属于较为简洁优雅的一类。

  CMO金牌得主汪千桐也给出了相似的结论:

  从数学审美的角度看,小红书大模型dots-note-3.0的解答非常漂亮也很优雅。

  常规解法已经很巧妙,但dots直接攻克了题目最难、也最本质的部分。

  在他看来,dots解题简洁明了而且直击本质。

  看完以后,会觉得每一步都顺理成章,但真正拿到题目时,人类选手很难想到能从这个角度切入。

  换句话说,IMO满分金牌或许还远不是小红书大模型dots-note-3.0能力的上限。

  为什么当前的大模型需要IMO

  先来个科普,讲讲IMO究竟是什么,又为何各家都在争先送自家大模型上考场。

  IMO又叫国际数学奥林匹克竞赛,每年全世界最顶尖的中学生云集于此。

  陶哲轩等几乎半数当代菲尔兹奖得主都是从IMO出来的,谷歌联创Sergey Brin也拿过IMO金牌。

  比赛一般分两天进行,每天4.5小时需要完成3道题,总计6道题,覆盖代数、组合、几何和数论四个方向。每题7分,满分42分。

  但光有答案还不算数,参赛者要想拿分,必须写出逻辑完整、能接受逐步审查的证明过程。

  这对大模型来说,难度极高,却也是最直观的能力展示途径。

  以Gemini为例,2024年谷歌首次挑战IMO,最终只拿到28分的银牌水平,彼时系统也还需要先将自然语言题目翻译成Lean等形式化语言,部分题目耗时甚至长达数天。

  第二年卷土重来,Gemini Deep Think直接以自然语言端到端完成证明,用4.5小时就解决了5道题,获得金牌。

  这背后是一次跨代的能力跃迁。

  往深了说,数学就是大模型智力与推理能力的试金石,大模型在IMO这类数学竞赛中走得越远,越能说明其底层优势。

  再举个最近的例子,就在本周,Fable 5参与构造了一个雅可比猜想反例。

  该猜想自1939年提出以来悬而未决长达87年,连张益唐等顶尖数学家都曾在此折戟。

  这次找到的反例虽尚未经过正式同行评审,但也标志着大模型现阶段的能力足以参与真正的数学发现。

  而数学竞赛,正是模型进入科研深水区之前,那道最硬核的能力门槛。

  除此之外,IMO还有一个相比Benchmark得天独厚的优势——未知。

  每届比赛的赛题都是由专家命制,在正式比赛前严格保密。

  也就是说,模型不可能提前拿到原题,实时参与当届比赛,也能够确保模型无法提前进行针对性训练。

  一位头部模型研究员对此给出了这样的判断:

  在今天的模型训练里,你基本可以认为,互联网上一旦出现了某些数据,很快就会被模型拿去训练,模型也就知道了。

  所以如果要测试一个模型到底聪不聪明,只能测一些没有公开过的东西。

  这恰是同步参与官方IMO测评之于大模型最难复制的价值。

  它考验的不是模型记住了多少题目和数学知识,而是在一个真正未知的问题第一次出现时,模型能否独立理解、探索,并最终完成严密推理。

  而且只有新题还不够,官方评测采用的是严格的当届赛事流程。

  每个比赛日的学生考试结束后,模型团队才会收到当天题目,并须在规定期限内提交PDF答卷。

  模型将直接阅读英文题目并生成证明,工作人员只负责保障系统运行。

  最终答卷则由来自不同国家的IMO评审员,按照正式标准进行审阅。

  本届新题、规定时间、完整证明、第三方专业评审,当这些条件同时成立,才让IMO成为现下很难靠背题和包装绕过去的能力大考。

  一分没丢,比拿到金牌更难

  正因如此,这次小红书大模型dots-note-3.0能拿到金牌,还是满分,就显得格外醒目。

  六道题全部做对,首先证明的是Agentic推理系统稳定性。

  模型需要读懂自然语言条件,判断哪些信息真正关键,提出可能成立的中间结论,再将它们组织成一套完整证明。

  整个过程中,任何一个条件被误读、任何一次推导跳步,都会留下可以被评审直接指出的漏洞。

  小红书大模型dots-note-3.0能够在六类不同问题中连续拿满,意味着它的表现并非依赖某一道题上的偶然灵感迸发。

  其次,小红书大模型dots-note-3.0直接一步到位,使用自然语言端到端处理,也意味着模型能够像人类选手一样直接读懂题目、自主寻找路径,具备从问题理解到答案表达的完整闭环。

  它代表模型拥有可迁移的通用推理能力。

  具体来说,在本次答题过程中,小红书大模型dots-note-3.0用智能体的方式,让模型使用自然语言结合python代码执行来推理解题。

  在推理过程中,也会借助递归自我批判能力,审视自己的论证,从而解决更多现实中的复杂任务。

  △图片由AI生成

  不过,让人真正感到惊喜的,还是第三题传递出的模型创新思维。

  这是一道组合博弈问题,网上关于本届IMO赛题讨论的常见解法,是先将原问题转化成图论中的连通性问题,再借助图论语言建立证明。

  这条路线本身已经非常巧妙,但小红书大模型dots-note-3.0没有沿用它,而是转用归纳。

  小红书大模型dots-note-3.0的解法,抓住了问题最本质的结构,设计出了恰到好处的归纳对象与归纳命题。

  这也解释了,为什么CMO得主汪千桐会用漂亮和优雅来形容这套答案。

  小红书大模型dots-note-3.0对问题结构的剖析之深,会让人自然而然产生一种恍然大悟的感觉。

  回到结果本身上,模型能够在本届拿下满分,其实相当不易,我们可以从以下几个层面来看。

  第一层,本届整套赛题的得分难度明显高于去年。

  2026年IMO金牌线为29分,去年则高达35分,短短一年,金牌线下降了6分,几乎是一整道题的分数。

  所以这一届的金牌,较之去年的Gemini,分量更重。

  第二层,满分与金牌之间亦有差距,今年整整相差13分。

  29分意味着,选手完整解决4道题,再从剩余两道题中拿到1分,就已经能够进入金牌区间。而小红书大模型dots-note-3.0全部all in,直接抵达了这套试卷能够衡量的最高点。

  毕竟老话说得好,满分只是卷面的上限,不是它的上限。

  金牌的确代表进入了全球最顶尖的一批,但满分则代表在这批顶尖选手中,再完成一次极小概率筛选。

  小红书大模型dots-note-3.0即将开源

  选择IMO作为起始站,也是小红书非常聪明的一步。

  如今行业内,想要把大模型底层技术能力推广出去,一般是两个方向,一个是Coding,另一个就是数学。

  原因也很简单,这两种任务的结果,都很难靠语言包装蒙混过关,相比知识问答和主观评测,它们更直接地考查模型能否真正理解复杂问题、拆解任务并持续推进。

  IMO更是其中的佼佼者,知名度高、业内认可度也够,直接给到的是模型面对高难度未知问题时,所展现出的深度推理能力。

  所以对小红书而言,这是一次重要的技术亮相。

  过去,外界对小红书的技术认知,更多集中在内容社区、推荐算法和内容理解上。

  在基础模型领域,小红书究竟处于什么位置,一直缺少一份足够公开权威,而且不需要复杂解释的成绩单。

  参数规模很难直接等同于能力,常规Benchmark上的几个百分点,也难让行业形成鲜明认知。

  IMO满分不一样,42分就摆在那里,足以证明,小红书已经具备值得行业认真审视的基础模型能力。

  它用一枚IMO满分金牌,让行业第一次看清了自己的技术成色——

  基础模型领域,出现了一个值得关注的新玩家。

  P.S.对应模型即将开源~敬请期待