南开大学北理工等团队成功破解AI学习困境
南开大学、北京理工大学等机构联合提出蒸馏强化学习,解决AI训练中强化学习进步慢与在线蒸馏盲目模仿的困境。该方法让学生在回答好时参考老师偏好,回答差时恢复惩罚机制。实验表明,跨家族蒸馏场景下学生成绩提升显著,推理能力增强且资源消耗更低。
这项由南开大学、北京理工大学、浙江大学、中国科学院自动化研究所、哈尔滨工业大学与中关村学院等多家顶尖机构联合开展的研究,以预印本形式发表于2026年7月,论文编号为arXiv:2607.17247。对该主题感兴趣的读者可通过该编号查询完整论文,获取更详尽的技术细节。
你可能好奇,那些能写代码、解数学题、应对各种刁钻问题的AI助手,究竟是如何变得越来越聪明的?简单来说,它们的“进化”路径与人类学习并无本质区别——要么通过反复练习、在错误中自我成长,要么跟随更强大的导师,从高手那里汲取经验。然而,这两种方式各有短板:一个仅靠自我刷题的学生容易遭遇瓶颈,而一味模仿高手的答案又难以真正掌握精髓。这篇论文提出的“蒸馏强化学习”(Distilled RL),正是为破解这一两难困境而设计。
一、两条路径,各有局限
要理解这项研究的出发点,首先需要了解AI模型目前主要通过哪两种方式来“提升智能”。
第一种方法称为强化学习(RL)。打个比方,这就像一个学生通过自己做题、核对答案来提升成绩。AI每次给出一个答案,系统会反馈“正确”或“错误”,AI据此调整自身策略。这种方式的优势在于AI完全依赖自身力量成长,不易受外界干扰;但缺点也很明显——它只知道最终结果的对错,却不清楚中间哪个环节出了问题。好比做一道数学题,老师只告诉你“算错了”,却不指出具体哪一步出错,你下次很可能在同样地方翻车。更关键的是,强化学习只能强化AI“已经掌握的能力”,对于那些从未接触过、完全陌生的知识领域,单纯依靠自我练习几乎无法突破。
第二种方法称为在线蒸馏(OPD)。这类似于让学生跟随大师实时学习——不是背诵大师留下的笔记,而是观察大师如何解题,并努力模仿其每一步思路。具体来说,AI学生先自行生成答案,然后逐字逐句地与AI老师(通常是一个规模更大、能力更强的模型)进行对比,极力让自己每个词的选择都与老师保持一致。这种方法的优势在于反馈极其细致,每个词都有明确指导;但缺陷同样突出。当老师与学生水平相近时,学习效果有限;而当两者差距过大时,强行模仿反而适得其反——就像让英语初学者直接效仿莎士比亚的写作风格,只会越学越混乱。
研究团队通过大量实验,清晰地观察到这两个问题的具体表现。在训练曲线图中,在线蒸馏在初始阶段进步迅速,但很快触及天花板,成绩开始停滞甚至下滑,尤其在老师和学生来自不同“家族”(即结构和训练背景差异显著)的情况下,这种下降更为明显。强化学习虽然进步缓慢,但能够持续攀升。将两者直接混合使用的方案,在训练后期同样出现性能衰退,说明简单叠加并不能解决根本问题。研究团队还特别验证了一点:增加在线蒸馏时AI自身的采样次数,无法改善瓶颈——将采样组数从1增加到4再增加到8,效果几乎没有变化。这表明问题的根源不在于“训练量不足”,而在于这种无条件模仿大师的学习方式本身存在缺陷。
二、新方法的核心思路:让老师成为“选择性顾问”,而非“必须照搬的权威”
既然两条路径各有不足,研究团队的思路是:将老师的指导融入强化学习过程,但不是让学生无条件地模仿老师,而是让老师在关键时刻提供精准、有选择性的指导。这正是“蒸馏强化学习”(Distilled RL)的核心理念。
可以用一个学棋的比喻来理解整个框架。假设你在学习围棋,你的师傅(老师模型)是一名高段位选手。传统的在线蒸馏,是让你每走一步棋,都努力模仿师傅在相同情况下最可能的选择,无论你这一步最终是赢是输。而传统的强化学习,只告诉你这盘棋的最终胜负,至于哪步棋走对、哪步棋走错,全靠你自己推断。蒸馏强化学习则采用了一种更聪明的方式:它先让你按照自己的想法下棋,然后观察这盘棋的最终走向;只有当这盘棋整体上属于“值得学习的好局”时,才参考师傅在每一步棋上的偏好,让你从师傅那里汲取更多智慧;而当这盘棋本身就是一场失败的烂棋时,则直接沿用强化学习的惩罚机制,不让师傅的偏好干扰“这步棋应受惩罚”的判断。
三、三个精妙的技术设计
这个框架的具体实现由三个环节组成,每个环节解决一个特定问题,三者共同构成完整的蒸馏强化学习。
第一个环节叫“反向重要性采样”
在强化学习中,有一个常用技巧叫重要性采样,其作用是将“旧版AI选择的方案”的权重,调整为适合“当前版AI”的权重。蒸馏强化学习将这一方向反转:它计算的是老师模型与旧版学生模型对每个词的“偏好差异比值”。具体来说,如果老师非常青睐某个词(老师选择该词的概率远高于学生旧版本),这个词就会得到一个大于1的权重;反之,如果老师对某个词不太感兴趣,这个词就会得到一个小于1的权重。这个权重衡量的是“老师比学生旧版本更偏好这个词的程度”。为防止该比值出现极端情况(例如某个词老师极度偏爱而学生完全不用,导致比值爆炸性增长),设计中对该比值进行了截断处理,将其限制在一个合理区间内,确保训练过程稳定可控。
第二个环节叫“负样本重置”
这是整个方法中最精妙也最关键的设计。回顾前面下围棋的比喻:当学生自己走的棋整体上是“好棋”(即本次回答质量较高、整体评分为正)时,引入师傅的偏好来调整每一步棋的权重是有意义的——师傅偏爱的步骤得到强化,师傅不喜欢的步骤被相对削弱,从而在“好的大方向”下实现更精细的优化。但当学生走的棋整体上是“烂棋”(本次回答整体评分为负)时,情况就不同了。在强化学习中,“烂棋”中的每一步都应受到惩罚,让AI明白“这样走是不对的”。如果此时还引入师傅的偏好,就会出现一个荒谬的结果:师傅偏爱的步骤,在“烂棋”中反而会因为权重变大而受到更严厉的惩罚,等于在逼迫AI刻意避开师傅的思路。这显然是错误的。负样本重置的解决方案非常直接:当一个回答整体评分为负时,直接将所有词的老师权重重置为1,即完全恢复到普通强化学习的状态,让原始的惩罚信号正常发挥作用,避免师傅的偏好在错误方向上“帮倒忙”。
第三个环节叫“序列级几何归一化”
这个设计解决的是一个更隐蔽的技术问题。AI生成一段文字时,是一个词一个词地依次输出,而整段文字的总概率,是每个词的概率相乘得到的。老师模型与学生模型毕竟是两个不同的模型,它们对整段文字的“总体喜好程度”在数量级上可能存在显著差异。如果将所有词的老师偏好比值直接相乘,结果可能非常小(远小于1),这样就会把好的回答整体“压缩”,导致训练信号整体变弱,学习效果不佳。几何归一化的做法是,对一个回答中所有词的老师偏好比值进行“整体校正”——将每个词的比值除以这个回答中所有词比值的几何平均数,使整体相乘结果等于1。这样一来,老师的指导就不是在整体上放大或缩小这个回答的重要性,而是在回答内部重新分配学习的侧重点:老师更偏爱的词获得更多关注,老师不太偏爱的词获得相对较少的关注,而整体的学习力度保持不变。
四、一个优雅的“验证实验”:用温度来测试知识传递
仅凭最终的评分表来说明效果还不够直观,研究团队设计了一个非常巧妙的案例研究,直接展示蒸馏强化学习是否真的能够传递知识。
这个实验利用了一个叫“熵”的概念。在AI语言模型的语境中,熵可以理解为“AI在选词时的不确定性”或“AI选词的随机程度”——熵高说明AI给许多候选词分配了相近的概率,不太确定选择哪个;熵低则说明AI非常笃定地认为某个词最合适。通过控制温度参数(一个影响AI选词随机性的数值),可以人为地让模型变得“更犹豫”(高温度、高熵)或“更果断”(低温度、低熵)。
实验的巧妙之处在于,研究团队没有使用一个更大的外部模型当老师,而是用学生模型自身充当老师——但为其设置了一个会随时切换的温度控制规则:当学生当前的熵值超过0.5时,老师就切换到低温度(0.8),告诉学生“你现在太犹豫了,要果断一点”;当学生的熵值低于0.5时,老师就切换到高温度(1.2),告诉学生“你现在太死板了,要灵活一点”。
如果蒸馏强化学习真的能够传递老师的分布特征,学生的熵值就应该在0.5附近来回振荡,跟随老师的温度信号变化。实验结果清晰地显示,学生的熵值确实迅速向0.5靠拢,然后在这个目标区域附近持续振荡——老师降温时学生熵值下降,老师升温时学生熵值上升,整个系统像一个精准的恒温器。这个实验直接证明了蒸馏强化学习能够将老师分布的特征性质传递给学生,而这种传递是原始强化学习完全无法做到的,因为原始强化学习的信号只有最终答案是否正确,不包含任何关于分布特征的信息。
当去掉“负样本重置”这个环节再做同样的实验时,学生的熵值完全无法跟随老师的温度信号,始终维持在一个远低于目标的水平。这个对比实验直观地说明了负样本重置对于知识传递的关键作用——没有它,在负样本上反向施加的老师偏好权重会抵消甚至压制正样本上的正确引导。
五、实验结果:在各种难度的考场上都更胜一筹
研究团队在多个评测维度上验证了蒸馏强化学习的效果,对比对象包括三个基准:单独使用在线蒸馏(OPD)、单独使用强化学习(RL,具体采用GRPO算法)、以及两者直接相加混合使用(OPD+RL)。测试的学生模型包括规模为15亿参数的DeepSeek-R1-Distill-Qwen-1.5B(简称DSQW-1.5B)、规模为17亿参数的Qwen3-1.7B以及规模为40亿参数的Qwen3-4B,老师模型统一使用规模为80亿参数的Qwen3-8B-GRPO。训练数据集使用DAPO-17K,共训练160步。
在最难的测试场景中,表现的差距最为显著。DSQW-1.5B和Qwen3-8B-GRPO之间不仅参数规模差距悬殊,而且两者来自完全不同的模型“家族”(一个是DeepSeek系列,一个是Qwen系列),推理风格和内部结构都有很大差异,这被称为“跨家族蒸馏”场景。在这个场景下,在线蒸馏虽然比不训练要好,但比单纯用强化学习还差,说明硬性模仿在家族差异很大时根本行不通。将两者混合使用也没有帮助,后期同样出现性能下滑。蒸馏强化学习则实现了最大幅度的提升,将DSQW-1.5B的综合成绩从31.70分提升到了40.00分,比在线蒸馏高出4.73分,比纯强化学习高出3.14分。
在Qwen3-4B这个“同家族”场景下,整体成绩从46.33分提升到了58.96分,比在线蒸馏高出2.99分,比纯强化学习高出1.56分。Qwen3-1.7B同样实现了稳定的全面领先。训练过程中的动态曲线也清楚地显示,蒸馏强化学习的奖励值始终保持在最高水平,策略的随机性(熵)保持在一个适中且稳定的区间,既不会因为过于随机而难以收敛,也不会因为过于保守而失去探索能力,回答长度也保持稳定,没有出现“越回答越短”或者“越回答越啰嗦”的异常现象。
在知识类测评(MMLU-Pro和SuperGPQA)上,蒸馏强化学习同样保持了竞争力,说明这种训练方法没有让AI“只会解数学题”,而是在提升推理能力的同时保留了广博的通识知识。在Pass@16评测(即同一道题让AI回答16次,看能否至少有一次答对)上,蒸馏强化学习同样表现最佳,说明它不仅提高了AI最常给出的那个答案的质量,还拓宽了AI整体的答题能力分布。
六、去掉某个环节会发生什么
研究团队还做了消融实验,分别去掉负样本重置和序列级几何归一化,来验证每个设计的必要性。
去掉负样本重置的后果最为严重。在Qwen3-4B上,综合成绩平均下降了8.81分;在DSQW-1.5B上,平均下降了6.39分。这个下降幅度甚至比完全不用老师指导还要差,直接说明了在错误回答上盲目引入老师偏好,不仅没有帮助,反而是有害的。前面提到的熵控制实验里,去掉这个环节后学生完全无法跟随老师的温度指令,也从另一个角度印证了这一点。
去掉序列级几何归一化的后果相对温和一些,但同样稳定地导致性能下降,在两个学生模型上分别下降了1.24分和1.47分。这说明即使方向对了(只在正样本上引入老师权重),如果不做整体校正,老师和学生之间的概率尺度差异还是会系统性地压制学习信号,让训练效果打折扣。
七、这个方法还有什么局限性
研究团队在论文中也坦诚地指出了这个方法目前的不足之处。最核心的限制在于,整个训练过程中老师只被用来评估学生自己写出来的答案,而不是被要求自己先写出正确答案来。这意味着训练过程无法直接判断老师对某道题是否真的会做。虽然负样本重置机制在一定程度上缓解了这个问题(因为在学生自己也答错的题目上,老师权重会被归零),但仍然存在一个隐患:在那些学生答对了、但老师其实并不比学生强的题目上,老师的词偏好权重可能反而是一种干扰,把学生往错误的方向引导。随着训练推进,学生的能力在某些领域可能超过了固定不动的老师,这时候老师的“意见”就会变得不那么可靠。未来的改进方向可以考虑给老师设置一个“能力评估”机制,比如偶尔让老师也完整地回答一道题来检验它是否真的会做,或者根据老师给出建议的一致性和置信度,动态调整对老师建议的参考程度。
说到底,这项研究解决的问题可以用最简单的话来描述:以前的AI训练方法,要么让AI只靠自己摸索(进步慢、遇到瓶颈),要么让AI无条件模仿老师(容易过拟合、跨家族时适得其反),而蒸馏强化学习找到了一条中间道路——让老师在合适的时机、以合适的方式、选择性地给出精细指导,而不是当一个学生必须全盘照搬的权威。实验结果表明这条路走对了,尤其是在老师和学生差异最大的情况下,优势最为明显。对于普通用户而言,这意味着未来的AI助手有望在更少的计算资源消耗下达到更高的推理能力,特别是那些规模较小、可以在普通设备上运行的AI模型,也能借助更大模型的知识来弥补自身能力的不足,这对于AI技术的普惠化有着直接的推动意义。有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.17247查阅完整论文。
Q&A
Q1:蒸馏强化学习和传统知识蒸馏有什么本质区别?
A:传统知识蒸馏让学生模型无条件地在每一步都模仿老师的词概率分布,不管学生自己的回答好不好。蒸馏强化学习只在学生回答整体较好的情况下才参考老师的逐词偏好,在学生回答较差的情况下会恢复为普通强化学习的惩罚机制,本质上是把老师的指导变成了“有条件的精细辅助”而不是“无条件的全面模仿”。
Q2:蒸馏强化学习为什么在跨家族蒸馏里效果特别明显?
A:跨家族指的是老师模型和学生模型来自完全不同的训练背景和架构系列,二者的用词偏好和推理风格差异很大。传统在线蒸馏在这种情况下因为强行模仿而导致性能下降,而蒸馏强化学习通过负样本重置和几何归一化,避免了对差异化分布的盲目跟随,只保留了相对有用的老师偏好信号,因此在差异最大的场景下反而收益最显著。
Q3:负样本重置去掉之后为什么成绩会比不用老师还差?
A:当一个回答整体是错误的,强化学习本应对其中每个词施加惩罚。但如果此时加入老师偏好权重,老师比较喜欢的词反而会因为权重变大而受到更重的惩罚,等于在错误轨迹上把老师偏好当成了“需要避免”的行为来训练,方向完全反了。这不仅浪费了老师的参考价值,还会主动把学生推向与老师相反的方向,造成比不引入老师还要差的结果。
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径
2026中国航空产业大会与南昌航空产业博览会将于10月31日至11月4日在南昌国际博览城首次同期举办。大会聚焦低空经济,设置主旨报告、行业专家报告及低空产业洽谈会等主题活动,旨在探讨航空产业新路径,推动低空物流、城市巡检等新业态集聚,打造中部领先、全国知名的航空产业交流高地。
联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南
联想来酷Air 16酷睿5 315版于8月27日正式开售,搭载6核处理器与12GB内存,配备16英寸16:10屏幕。叠加国家补贴后预估到手价仅3739 15元,主打长续航与静音办公。本文详细解析其硬件配置、接口布局及购买建议,助您快速决策。
牛来AirPods保护套海外走红:萌趣硅胶设计引发关注
一款名为“牛来”的AirPods硅胶保护套在日本市场引发关注,售价约1726日元。其独特的搞怪萌趣造型、兼容多代机型的硅胶材质以及专属挂饰设计,使其在社交平台上迅速走红,成为近期备受瞩目的国产原创数码周边产品。
行李箱选购全攻略:材质、轮子与尺寸避坑指南
选购行李箱时,材质、轮子和尺寸是核心决策点。PP材质抗冲击且轻便,适合频繁托运;万向轮决定推行顺滑度;尺寸需匹配航空限重。本文拆解关键参数,结合具体产品案例,助您选出耐用且实用的行李箱。
《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验
2026年8月《湮灭之潮》成都试玩会圆满举行,千名玩家现场体验西方奇幻大作。文章重点解析技嘉RTX 5080风魔显卡在虚幻5引擎下的表现,涵盖Blackwell架构、DLSS 4 5技术及16GB GDDR7显存对高画质流畅运行的支撑作用。
- 热门数据榜
1
2
3
4
5
6
7
8
9
10
相关攻略
2026-08-31 11:17
2026-08-28 14:44
2026-08-28 14:44
2026-08-28 14:44
2026-08-28 14:43
2026-08-28 14:43
2026-08-28 14:43
2026-08-28 14:42
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程

