当前位置: 首页
科技数码
小红书dots模型AI拿下IMO满分金牌,42分比肩全球7位人类天才

小红书dots模型AI拿下IMO满分金牌,42分比肩全球7位人类天才

热心网友 时间:2026-07-23
转载

小红书的dots-note3 0模型在第67届国际数学奥林匹克中获满分金牌(42 42分),全球仅7位人类选手达成此成绩。该模型不依赖形式化语言,直接读取原始LaTeX题目,通过递归自我批判能力端到端解题,且是dots3系列最轻量级模型,预期将开源。

IMO满分金牌——这是AI数学推理能力的"图灵测试"级别里程碑

2026年7月21日,这一天,注定将被载入人工智能的发展史册。小红书dots团队携dots-note 3.0模型参加了第67届国际数学奥林匹克竞赛(IMO 2026),最终成绩令人震撼:六道题目全部获得满分,以42/42分的成绩摘金。在全球范围内,仅7位人类参赛者达到了这一卓越水平。

这并非一个简单的"AI又考了个高分"的新闻。IMO是地球上难度最高的数学竞赛,没有之一。每年,全球最顶尖的高中生在IMO赛场上激烈角逐,能够获得满分的选手凤毛麟角。2026年,全球仅有7位人类选手荣获满分金牌。如今,人工智能也实现了这一壮举。

更令人瞩目的是:dots-note 3.0无需依赖形式化语言,能够直接读取原始的LaTeX题目,并凭借其递归自我批判能力,端到端地完成解题过程。而且,它还是dots3系列中参数规模最小的模型。

"IMO满分金牌这个里程碑,其背后是模型递归自我批判能力的重大突破。不依赖形式化验证就能给出严谨的数学证明,这为数学推理研究领域释放了真实信号,从事推理方向的研究者值得深入研读。"——AIHOT编辑推荐语

IMO满分意味着什么?不仅仅是"AI会做题"

许多人会问:AI能够考出IMO满分,这究竟与我们有何关联?

答案是:IMO满分所验证的,不是"AI会做题"的能力,而是"AI具备了推理能力"这一事实。

IMO的题目绝非"1+1=2"的简单计算题。每一道IMO题目都要求解题者具备创造性的数学思维——你需要从零开始构建证明思路,尝试不同的解题路径,在遇到死胡同时能够回溯,并最终找到一条优雅的证明之路。这远非"模式匹配"所能解决,这是真正的"推理"过程。

过去,AI在数学推理领域的表现始终差强人意。大型语言模型可以"背诵"已知的数学定理,但面对需要原创性思维的新问题时,往往会"胡编乱造"。这正是IMO一直被视为AI"终极考场"的原因——它考察的不是知识储备,而是创造力。

dots-note 3.0的满分成绩,意味着人工智能首次在需要"创造性推理"的顶级智力竞赛中,达到了人类顶尖水平。这并非"AI的记忆力比人类强",而是"AI的推理能力正在逼近人类"。


递归自我批判——让AI在解题过程中不断"反思"自己的推理,是这次技术突破的核心

递归自我批判:dots-note 3.0的核心秘诀

dots-note 3.0最引人注目的技术特点,便是其递归自我批判能力。

究竟什么是递归自我批判?简单来说,就是让模型在解题过程中持续"反思"自己的推理是否正确。传统的大模型在推理时往往是"一条路走到黑"——给出一个答案,然后坚持这个答案不动摇。但dots-note 3.0截然不同:它在生成每一步推理之后,会主动检查这一步的逻辑是否严密、是否存在漏洞、是否还有更优雅的解法。

这类似于人类数学家的工作方式:并非"写下一个答案就完事",而是"反复推敲、反复修改、反复验证"。高斯不会因为第一次尝试就得到正确答案而停止——他会继续寻找更优美的证明。dots-note 3.0的递归自我批判,本质上是在模拟这种"数学家式的思维模式"。

值得注意的是,dots-note 3.0不依赖任何形式化验证工具(如Lean、Coq等)。这意味着它无需将数学问题翻译成形式化语言,而是直接读取人类撰写的LaTeX题目,运用人类的数学语言进行推理。这一能力,比依赖形式化工具的方案更接近"人类式的数学思维"。

dots-note 3.0 IMO 2026 核心数据
IMO成绩:42/42分,满分金牌
人类对比:全球仅7位人类选手获满分金牌
解题方式:不依赖形式化语言,直接读取原始LaTeX题目
核心技术:递归自我批判
模型规模:dots3系列最轻量级模型
开源状态:预期将开源
团队:小红书 dots 团队

小红书做AI?从"种草"到"IMO金牌"的跨越

许多人对于小红书的印象还停留在"种草平台"。然而,dots团队在AI数学推理领域的突破,让人们不得不重新审视这家公司的技术实力。

小红书dots团队并非突然崛起。dots系列模型一直在数学推理、代码生成等方向上深耕细作。dots3系列在多个基准测试中均表现出色。但IMO满分金牌,无疑是其最具冲击力的"成绩单"。

这背后折射出中国AI行业一个值得关注的发展趋势:非传统AI公司正在AI核心技术领域取得突破。不仅仅是BAT和字节跳动,小红书、快手、美团等公司也在AI研发上投入了巨额资源。这些公司拥有独特的业务场景和海量数据,当它们将AI能力与自身业务深度融合时,往往能产生意想不到的化学反应。

dots-note 3.0预期将开源,这意味着全球的数学家和AI研究者都能够基于这个模型进行更深入的研究。这不仅是小红书的胜利,也是开源AI社区的胜利。


从"会解题"到"能发现新的数学定理"——AI数学推理的下一站

从IMO满分到"AI数学家":还有多远?

IMO满分是一个重要的里程碑,但它并非终点。从"能解IMO题"到"能发现新的数学定理",中间还横亘着巨大的鸿沟。

IMO的题目,无论多难,本质上都是"已知有解"的。每道题都有标准答案,且经过评委会提前验证。AI所做的是"找到已知的答案"。然而,真正的数学研究,面对的是"不知道有没有解"的问题——你甚至不确定答案是否存在,也不确定这条路是否走得通。

这种"在不确定性中探索"的能力,是当前AI所不具备的。人类数学家可以花费数年甚至数十年研究一个猜想(例如费马大定理,历经358年才被证明),但AI目前还无法胜任这种"长期、开放式"的探索工作。

不过,腾讯混元同日发布的Hyra-1.0模型给出了一个方向:递归自我改进的研究智能体。Hyra在55个数学开放问题中刷新了29个历史最佳结果。如果dots的"递归自我批判"与Hyra的"递归自我改进"能够结合,AI自主进行数学研究的那一天,或许比我们想象的更近。

AI数学推理的三条技术路线

形式化验证路线(Lean/Coq):将数学问题翻译成形式化语言,使用定理证明器进行验证。优点是100%可靠,缺点是翻译成本高、灵活性不足。

端到端推理路线(dots-note 3.0):直接读取人类数学语言,自主进行推理。优点是灵活、贴近人类思维,缺点是可靠性不如形式化验证。

递归自我改进路线(Hyra-1.0):让AI在推理过程中不断优化自己的策略。优点是可能发现人类尚未发现的解法,缺点是稳定性有待提升。

冷静看待:IMO满分背后的"冰山"

尽管dots-note 3.0的IMO满分令人振奋,但仍有几个现实问题值得冷静思考:

42分≠42分。AI的42分与人类的42分,在意义上并不完全相同。人类选手在考场上仅有几个小时,无法查阅资料,也无法重试。AI的"考试环境"是否与人类完全一致?如果AI可以多次尝试、并选择最优答案,那么该"满分"的含金量就需要更透明的评估标准。

最轻量级模型拿满分,说明了什么?dots-note 3.0是dots3系列中最轻量级的模型。这固然说明了"小模型也能有大能力",但反过来也意味着:IMO题目可能被"过拟合"了。如果模型在训练数据中见过类似题目,那么满分就不完全等同于"推理能力"的体现。

从"解题"到"发现"的鸿沟。如前所述,IMO题目是"已知有解"的。真正的数学研究是"探索未知"。AI能否从"解题工具"进化为"发现工具",是下一个需要回答的问题。

IMO满分金牌是一座里程碑,但其真正意义不在于"AI比人类聪明",而在于"AI终于开始理解'推理'这件事了"。当AI不仅能"算出"答案,还能"想出"答案、"批判"自己的答案时,我们距离通用人工智能就更近了一步。这条路,才刚刚开始。

来源:https://www.163.com/dy/article/L2FHJES00535ORBB.html

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

同类文章
更多
罗福莉入选新一届35岁以下科技创新35人中国区名单

罗福莉入选新一届35岁以下科技创新35人中国区名单

2025年《麻省理工科技评论》“35岁以下科技创新35人”中国区名单在上海发布,罗福莉、姚顺宇等入选。罗福莉推动大模型从“能聊天”走向“能干活”,探索智能体演进;姚顺宇建立非厄米拓扑能带理论。本届AI+机器人领域入选者占四成。

时间:2026-07-25 21:58
美国科技巨头为AI投资年内裁员近14万人

美国科技巨头为AI投资年内裁员近14万人

美国科技巨头年内裁员近14万人,同时计划在AI基础设施上投入7250亿美元。裁员主要目的为AI投资腾出资金并纠正疫情期间过度招聘,市场对AI相关裁员反应负面,而AI初创公司正加速扩招,形成对比。

时间:2026-07-25 21:58
位AI Infra高管复盘WAIC:暴力美学触顶后求变?

位AI Infra高管复盘WAIC:暴力美学触顶后求变?

WAIC2026上,AIInfra行业关注点从算力规模转向推理效率与Token产出。Agent驱动Token消耗激增,AI工厂与Token工厂成为关键载体。效率竞争取代规模竞赛,玩家分层加速,具备全栈优化能力的头部厂商优势凸显。

时间:2026-07-25 21:58
显卡厂商封仓引发涨价 玩家面临高价购买

显卡厂商封仓引发涨价 玩家面临高价购买

显卡市场,恐怕又要迎来一波涨价潮了。过去两年,不少玩家咬咬牙买下的高价显卡,如今回头看,竟然成了抄底。但问题在于,硬件市场每一次涨价,最终买单的永远还是玩家。 业内消息显示,GDDR7显存价格出现了明显上涨,单颗2GB显存价格上涨接近20美元。按8GB显存规格计算,一张显卡的显存成本或将增加约542

时间:2026-07-25 21:58
OpenAI加入签署AI开源模型公开信,组织达35家

OpenAI加入签署AI开源模型公开信,组织达35家

7月25日,微软、英伟达等25家美国公司联署公开信支持开放权重AI模型,随后签署方增至35家,新增包括OpenAI等。开放权重模型可下载、修改、运行,能扩大创新、强化竞争并降低风险,避免AI收益集中于少数巨头。

时间:2026-07-25 21:28
热门专题
更多
刀塔传奇破解版无限钻石下载大全 刀塔传奇破解版无限钻石下载大全
洛克王国正式正版手游下载安装大全 洛克王国正式正版手游下载安装大全
思美人手游下载专区 思美人手游下载专区
好玩的阿拉德之怒游戏下载合集 好玩的阿拉德之怒游戏下载合集
不思议迷宫手游下载合集 不思议迷宫手游下载合集
百宝袋汉化组游戏最新合集 百宝袋汉化组游戏最新合集
jsk游戏合集30款游戏大全 jsk游戏合集30款游戏大全
宾果消消消原版下载大全 宾果消消消原版下载大全
  • 热门数据榜