KAIST团队如何让强化学习训练突破无聊题目瓶颈
韩国科学技术院联合多机构发现,强化学习训练中题目难度与AI能力不匹配会导致学习信号归零。提出LLM-as-a-Tutor框架,让大模型同时担任阅卷与出题者,动态追加条件使题目难度随AI能力自动升级。实验表明,该方法在指令遵从测试中平均分51 96,优于所有基线方案。
先说几个核心判断:在AI强化学习训练流程中,一个长期被忽视的关键瓶颈,是题目本身的难度不足。这个问题的棘手之处在于,它会使整个训练系统在表面上“一切运转正常”的假象下,彻底丧失有效的学习信号。
这项由韩国科学技术院(KAIST)联合Upstage、多伦多大学、卡内基梅隆大学及英伟达研究人员共同完成的研究,于2026年7月5日以预印本形式发布,论文编号为arXiv:2607.04412。

如果老师出的题目过于简单,会怎样?
想象一下,你正在备战高考,但每天刷的练习题都停留在小学水平——加减乘除,闭着眼也能拿满分。即使刷上一万道题,你的数学能力能提高吗?答案几乎是否定的。这正是当前AI强化学习训练中,研究团队精准捕捉到的一个核心困境。
强化学习,通俗地讲,是一种让AI通过“做题—得分—改进”的循环,不断自我提升的训练方法。AI就像一个备考的学生,反复练习,并根据得分来调整自己的答题策略。在数学、编程这类有标准答案的领域,评分系统(自动评分程序)可以精确判定每道题的对错。但当训练目标是“写一篇好文章”或“给出一个有说服力的建议”这类没有唯一答案的任务时,就需要一位“阅卷老师”——通常是另一个大型语言模型——来进行主观评分。
近年来,研究者发现,让这位“阅卷老师”使用为每道题量身定制的评分标准(rubric,即评分细则),比笼统地问“这篇文章写得好不好”要有效得多。这就像语文老师批改作文时,手里拿着“是否有论点、论据、论证,字数是否达标,开头是否吸引人”这样的具体评分表,而不是仅凭感觉打分。这套方法在业内已被验证有效。
然而,KAIST团队在研究中发现了一个更深层的问题:无论这位“阅卷老师”有多专业,评分细则有多细致,如果学生(AI)面对的题目本身就不够难,所有答案都能轻松获得满分,那么“老师”也无法区分出哪个回答更好。此时,无论评分标准多么精妙,传递给AI的学习信号都会归零。
一、“卷面满分”的陷阱:AI训练为何会失去方向感
要理解这个问题,需要先明白强化学习中的一个关键机制——“区分度”。强化学习的核心逻辑是:AI同时生成多个不同的答案,通过比较这些答案的得分高低,来判断哪个回答方向更优,然后朝那个方向优化自身。这个过程在技术上被称为计算“优势值”(advantage),本质上就是给每个答案打一个相对排名。
如果AI对某道题的所有答案都得了100分,那么这些答案之间的得分差为零,“优势值”也就全部归零——AI完全不知道应该往哪个方向改进,因为所有方向看起来都一样好(或一样差)。这就像全班同学都考了满分,老师却想根据这次考试来区分优劣、决定谁需要补课,这根本无从下手。反之,如果所有答案都是零分,同样没有区分度,AI也无法学到任何有用信息。
真正能产生有效学习信号的,是那些让AI“有些会、有些不会”的题目——某些答案得高分,某些得低分,AI才能从这种对比中知道哪里做对了、哪里做错了,从而不断改进。研究团队将这种能产生有效学习信号的题目称为“对当前AI具有挑战性的题目”。
问题在于,现有的AI训练流程通常从一个固定的题库中抽取题目,这些题目在设计时,并不知道正在训练的AI当前的能力水平。随着AI在训练过程中变得越来越强,早期那些困难的题目可能会变得轻而易举,全部满分;而有些天生难度过高的题目,AI可能永远无法解答,全部零分。在这两种情况下,学习信号都消失了,但题库依然存在,程序仍在照常抽题,表面上一切正常——实际上,AI已经在原地踏步。
这正是KAIST团队所说的“政策-题目错配”(policy-prompt mismatch):题目的难度与AI当前的能力不匹配,导致评分系统无法产生有效的区分性信号。
二、“家教老师”登场:LLM-as-a-Tutor框架的核心思路
面对这一困境,研究团队提出的解决方案颇具创意。既然我们已经用一个大语言模型来担任“阅卷老师”,为什么不同时让它扮演“家教老师”的角色呢?
这正是“LLM-as-a-Tutor”(大语言模型作为家教)框架的核心思路。在该框架中,同一个语言模型身兼两职:既是评卷官,又是出题者。它能做到的是,在发现某道题对AI来说过于简单、不再具有挑战性时,悄悄地在题目后面增加一个新的附加条件,让这道题重新变得有难度。
要做到这一点,家教老师需要先判断一道题目前是否还具有挑战性。判断方法非常直观:让AI就同一道题作答两次,获取两份答案,然后比较这两份答案是否存在质量上的差异。如果两份答案几乎一模一样,水平相当,说明AI已经完全掌握了这道题,随手就能答好,没什么可学的了;如果两份答案存在明显的高下之分,说明这道题对AI仍有挑战性,值得继续练习。
为什么采用“两份答案比较”的方式,而不是直接给单个答案打分?研究团队引用了大量先前研究的发现:大语言模型在直接比较两个答案时,其判断力比单独给某个答案打分要准确得多,也更符合人类的直觉。这就好比让你评价一篇文章好不好,你可能拿捏不准;但如果给你两篇文章,让你说出哪篇更好,你往往能更快、更准地做出判断。
一旦判定某道题对AI来说不再具有挑战性,家教老师就进入它的第二个角色——出题改造者。它会在原题目后面追加一个新的具体要求(一个“原子条件”——即单一、明确、可评估的附加要求),使题目变得更难。与此同时,它还会为这个新条件补充对应的评分标准,并将其加入评分细则中。
这种“只追加、不改写”的设计有一个重要的数学保证:凡是能够满足新题目(原题+新条件)的答案,必然也满足原题目。换句话说,改造后的题目不会比原来更容易,只会更难或同样难。难度是单调递增的,不会因为改造而出现“实际上新题更简单”的情况。
三、家教老师的工作日程:每隔一轮,检查一次
具体到训练流程,家教老师的工作是这样安排的。在训练开始之前,家教老师会先为题库里的每道题生成一套基础评分细则,这套细则捕捉的是这道题本身最核心的质量要求,与AI当前水平无关,属于“永久有效”的基础评分标准。
训练进入循环后,每隔一个训练周期(例如每完成一轮完整训练),家教老师就会对每道题进行一次检查。对于每道题,它从当前版本的AI那里采样两个答案,进行“质量差异判断”。如果两个答案差异明显,这道题继续原样使用;如果两个答案差不多,家教老师就会给这道题追加一个新的附加条件,以及对应的新评分标准。
追加了新条件的题目,会在接下来的训练中替换旧版本题目投入使用。如果下一个检查周期到来时,AI对这道改造后的题目又变得游刃有余,家教老师会再追加一个条件,让题目更难。就这样,题目难度随着AI能力的成长而自动升级,形成一条个性化的、由AI自身行为驱动的学习曲线,无需任何人工设定难度等级,也不需要预先规划“第几周该学第几级”。
研究团队将这种现象称为“自我校准的训练信号”——信号的强弱由AI自己的表现来调节,AI越强,题目自动变得越难,从而确保学习信号始终处于有效状态。
四、实验细节:如何验证这套方法真的有效
研究团队选择了Qwen3-1.7B(一款拥有约17亿参数的语言模型)作为被训练的“学生AI”,并选用Qwen3-8B(约80亿参数,能力更强)作为“家教老师”兼“阅卷老师”。训练数据来自WildChat——一个包含真实用户与AI对话记录的大型公开数据集,从中随机抽取4000条对话作为训练题目,训练进行3个完整轮次,家教老师每个轮次检查一次,并在必要时进行题目改造。
评估选用了三个专门测试AI遵从复杂指令能力的基准测试:FollowBench(专门测试AI同时满足多个嵌套要求的能力,包含HSR和SSR两个子指标)、AdvancedIF(综合测试复杂指令遵从,包含Overall和Micro两个子指标),以及InfoBench(侧重信息质量的指令遵从,包含DRFR指标)。最终报告的分数是这三个基准测试在五次独立评估运行中的均值,以消除大语言模型评分自身的随机性。
作为对比,研究团队设计了几类基线方案,分别代表不同程度和方向的“政策适应性”:完全不修改题目的方案(直接用原题配基础评分细则;使用WildChecklists这套预先生成的高质量评分细则;以及动态调整评分细则以针对AI当前弱点的“政策自适应评分细则”方案);不依据AI当前状态、离线直接改写题目以增加难度的方案(Evol-Instruct);以及另一套依据AI当前得分差距来选题并改写题目的方案(EVA,需要说明的是,研究团队在复现EVA时进行了一些调整,以适配相同的训练框架,具体包括将训练算法从DPO改为GRPO、将改题模型从gemini-1.5-pro换为同款Qwen3-8B、将奖励信号从标量评分模型改为基于评分细则的评分)。此外,还有一个“蒸馏”方案,直接使用Qwen3-8B生成的答案对Qwen3-1.7B进行监督微调。
五、数字背后的故事:实验结果揭示了什么
实验结果显示,LLM-as-a-Tutor在三个基准测试上的平均分达到51.96,高于所有对比方案。未经训练的原始Qwen3-1.7B平均分为49.12;直接使用Qwen3-8B答案进行监督微调的蒸馏方案,得分反而下降至46.05,这说明直接“抄老师的答案”并不能提升AI遵从复杂指令的能力;使用基础评分细则训练得到50.51分;WildChecklists(更精细的预制评分细则)为50.72分;动态调整评分细则为51.04分;Evol-Instruct(盲目增加题目难度,不考虑AI当前水平)为50.24分,甚至不如基础评分细则;EVA(另一种政策自适应改题方法)为51.04分;LLM-as-a-Tutor以51.96分位居榜首,并在六项子指标中的五项上取得了最佳成绩。
这些数字背后有几个值得深入思考的故事。首先,Evol-Instruct的表现比什么都不改题目还要差,这直接说明“难题并非越难越好”——如果难度与AI当前能力脱节,难题不仅无益,反而有害。其次,动态调整评分细则与EVA达到了相同的51.04分,而LLM-as-a-Tutor超越了它们——这说明即便是专门为AI当前状态定制评分标准,也不如直接改变题目本身的效果好。原因在于:如果一道题无法让AI产生有好有差的答案,那么无论评分标准多么精妙,都无从发挥区分作用;而改变题目本身,才能从根本上恢复答案间的质量差异。
六、拆开来看:到底是哪个设计在起作用
为了弄清楚哪些设计选择真正有效,研究团队进行了两组对比实验。
第一组对比检验了“自适应性”本身是否关键。研究团队保留了同样的“追加条件”操作,但改变了触发时机:一种是对所有题目无差别追加条件(不管AI答得好不好);一种是随机选择28%的题目追加条件(28%与实际情况下平均触发比例一致);一种是用Qwen3-8B(而非正在训练的Qwen3-1.7B)来做答案质量判断(这会导致47%的题目被追加条件,因为更强的模型认为更多题目是“AI已经掌握了”);最后一种是实际采用的方法,即使用Qwen3-1.7B自己的答案来判断,触发28%的题目追加。结果显示,无差别追加(42.13分)和随机追加(42.82分)都不如自适应方法(43.19分),而使用8B模型来判断的方案(42.79分)也稍逊一筹。这说明关键不在于“追加了多少条件”,而在于“在正确的时机、针对正确的题目追加”——判断的依据必须是正在训练的AI自己的表现,而不是更强模型的表现,也不是随机选择。
第二组对比检验了“只追加”的方式是否优于其他改题策略。对比方案包括:每轮用新条件替换旧条件(Reset,不累积),以及直接将整道题改写为更难版本(Rewrite)。结果显示,Reset得分为42.40,Rewrite得分为42.88,而Append(追加)得分为43.19,追加方式效果最优。Reset和Rewrite都无法保证“新题必定比旧题更难”,Rewrite还有一个额外问题——整体改写可能导致题目偏离原始的语料分布,使训练信号与实际应用场景脱节。追加方式因为保留了原题内容,既保证了难度的单调递增,也保持了题目风格与原始语料一致。
七、家教老师有多靠谱:行为分析
研究团队还深入分析了家教老师自身的行为模式,以验证其判断是否真的可靠。
随着AI能力的增强,家教老师追加条件的频率会自动上升。研究团队使用固定的Qwen3-8B家教,分别配合0.6B、1.7B和4B三个规模的AI学生进行测试,追加比例分别为8.1%、25.8%和40.5%,呈现出明显的单调递增趋势。这符合直觉:AI越强,同样的题目对它来说越简单,家教老师就越需要追加条件。
更重要的是,家教老师判断为“有挑战性”的题目与判断为“无挑战性”的题目,在实际得分数据上存在显著区分。被判为无挑战性的题目,AI在完整答题组中的平均得分为90.76,标准差仅为12.96;被判为有挑战性的题目,平均得分为78.24,标准差高达27.07。高均值、低方差对应“AI轻松应对”,低均值、高方差对应“AI仍在挣扎”,这与家教老师的判断高度吻合,说明基于双答案比较的判断方法确实能有效捕捉AI的真实能力边界。
追加条件之后,题目对基础评分细则部分的影响也很有规律。随着追加条件数量从0增加到3个,基础细则部分的平均得分从约91.5逐步下降到90.0附近,而标准差则从约9逐步上升到约12。这说明新条件的加入不仅让整体题目变得更难(均值下降),还让AI在基础要求上也更难做到一致(方差上升)——因为同时要满足越来越多的要求,AI在基础部分的发挥也开始出现分化,基础评分细则的区分力得以延续。
八、一道具体的题目改造,让机制一目了然
论文中给出了多个具体案例,其中最典型的一个如下:原始题目要求AI写一封友好的工作场所邮件,内容包括问候员工女儿的健康情况、欢迎员工回来上班、说明公司规定请假超过两天需要医生证明,以及礼貌性结语。AI对这道题的所有答案都能轻松获得满分,8个答案的标准差为零——完全饱和了。
家教老师追加了一个条件:“邮件中需要注明要求医生证明的具体公司政策名称。”
改造后,AI答题出现了明显分化。答案A直接在邮件中写入了“[公司政策名称]”,明确引用了这条政策,基础细则得分100;答案B只是笼统地写“按公司规定”,让员工“咨询上司”,没有提到任何具体政策名称,基础细则得分只有60。此时,均值从100降至92.5,标准差从0升至14.9,学习信号重新被激活。
类似的案例在论文中还有几个。一道让AI解释“人文主义教学技巧”并列举五种教学法的题目,原始答案同样满分饱和;追加“说明每种教学法的创立者”后,两份答案开始出现不同程度的知识性错误,标准差从0上升到14.7。一道让AI为OSCOLA法律引用格式写说明的题目,追加“明确说明书目条目中哪些部分需要斜体,以及脚注格式的具体标点规则”后,一份答案正确区分了哪些部分需要斜体,另一份答案则错误地将所有部分都斜体化,甚至发明了并不存在的引用格式,区分度大幅提升。还有一道让AI写关于良心不安事项独白的题目,追加“加入一个亲身经历的小故事”后,一份答案巧妙地将故事融入对所有七件事的覆盖中,另一份答案则让狗狗生病的故事篇幅过长,完全挤掉了关于祖父母的部分——这恰好暴露了AI在多任务权衡上的不稳定性。
九、从“阅卷老师”到“家教”:一种新型知识蒸馏的可能
研究团队在讨论部分提出了一个更宏观的视角:LLM-as-a-Tutor可能代表了一种与传统“知识蒸馏”不同的新型学习模式。
传统的知识蒸馏是这样工作的:用一个大模型(老师)生成答案,让小模型(学生)模仿这些答案。学生的天花板由老师的答题能力决定,老师能写多好,学生最多学到多好。
而在LLM-as-a-Tutor模式下,大模型不直接提供答案,而是负责判断“哪道题对学生还有挑战性”,然后设计更有难度的题目,让学生通过强化学习自己探索出更好的答案。在这个过程中,学生的学习空间不受限于老师的答题上限,而是受限于老师的“出题和评判能力”——而一般来说,“判断两个答案谁好谁差”比“自己写出最好的答案”要容易得多,大语言模型在这方面已被多项研究证实具有较强能力。因此,学生AI的潜力上限理论上可以超越老师AI的直接产出能力,只要老师能持续出好题、做好评判。
这个思路也揭示了该方法的局限性所在:家教老师的能力边界决定了整套框架的效果上限。如果老师模型本身对某些领域的理解有限,它生成的追加条件可能质量不高,判断也可能出现偏差。随着更强的开源模型不断涌现,这个限制自然会随之改善。
此外,研究团队指出,这套框架在原理上不局限于“指令遵从”任务。只要某个任务存在可以追加的难度维度——比如推理任务可以追加推理步骤,编程任务可以追加边界情况,事实性问答可以追加更严格的来源要求——相同的思路都可以迁移应用。
研究团队也坦诚地指出了几个实际局限:实验仅在Qwen3-1.7B这一个学生模型上进行了完整的三个基准评估,受计算资源限制,没有覆盖更多模型家族和更大规模的学生模型(尽管0.6B到4B的规模扫描实验提供了间接证据);每次训练运行约需4张H100 GPU运行一天,评估成本每套方案约需15美元API费用;家教老师在每道题上需要额外的两次答案采样和一次判断调用(加条件时再多一次),不过相比已有框架中大量的评分调用,这部分额外开销占比不大。
归根结底,这项研究做的事情可以用一句话来概括:它发现了AI强化学习训练中一个被忽视的瓶颈——题目难度不足——并用一个优雅的“追加条件”机制解决了它,让整套训练系统能够随着AI的成长自动保持在最有效的难度区间。这种思路的意义不仅在于它带来了性能提升,更在于它揭示了一个此前被人忽略的训练维度:在调整“怎么评分”的同时,也要调整“用什么题目”。两者缺一不可,才能让AI训练中的学习信号始终有效流动。
对于普通人而言,这意味着未来使用的AI助手在应对复杂、多条件要求时的稳定性和准确性有望得到持续改善。有兴趣深入了解技术细节的读者,可通过arXiv编号2607.04412检索完整论文。
Q&A
Q1:LLM-as-a-Tutor框架和传统强化学习训练有什么本质区别?
A:传统强化学习训练使用固定题库,无论AI当前能力如何,题目难度保持不变。而LLM-as-a-Tutor会检测AI答题是否“饱和”(即两份答案质量相当),一旦饱和,就在题目后追加新条件,使题目变难,确保学习信号始终有效。核心区别在于,题目难度会跟随AI能力动态调整,而不是静态不变。
Q2:为什么追加条件比直接改写整道题效果更好?
A:追加条件具有数学上的保证——满足新题的答案必然满足原题,难度单调递增,不会倒退。而直接改写整道题则无法保证新题一定比旧题难,还可能偏离原始题目的语言风格和分布,导致训练后的AI在实际应用中表现欠佳。追加方式既保持了难度递增,也保留了原始语境。
Q3:强化学习训练里的“评分细则”(rubric)是什么,为什么它比普通评分更有效?
A:评分细则是一套针对单道题定制的具体评分标准,例如“是否有明确论点”“字数是否达标”等,类似于老师手中的评分表。相比笼统打分,细则能让评分模型区分“这篇文章哪里好、哪里差”,提供更精细的学习信号,减少AI靠格式凑字数等投机行为。LLM-as-a-Tutor在追加题目条件时同步追加对应的评分细则,确保两者始终对齐。
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
罗福莉入选新一届35岁以下科技创新35人中国区名单
2025年《麻省理工科技评论》“35岁以下科技创新35人”中国区名单在上海发布,罗福莉、姚顺宇等入选。罗福莉推动大模型从“能聊天”走向“能干活”,探索智能体演进;姚顺宇建立非厄米拓扑能带理论。本届AI+机器人领域入选者占四成。
美国科技巨头为AI投资年内裁员近14万人
美国科技巨头年内裁员近14万人,同时计划在AI基础设施上投入7250亿美元。裁员主要目的为AI投资腾出资金并纠正疫情期间过度招聘,市场对AI相关裁员反应负面,而AI初创公司正加速扩招,形成对比。
位AI Infra高管复盘WAIC:暴力美学触顶后求变?
WAIC2026上,AIInfra行业关注点从算力规模转向推理效率与Token产出。Agent驱动Token消耗激增,AI工厂与Token工厂成为关键载体。效率竞争取代规模竞赛,玩家分层加速,具备全栈优化能力的头部厂商优势凸显。
显卡厂商封仓引发涨价 玩家面临高价购买
显卡市场,恐怕又要迎来一波涨价潮了。过去两年,不少玩家咬咬牙买下的高价显卡,如今回头看,竟然成了抄底。但问题在于,硬件市场每一次涨价,最终买单的永远还是玩家。 业内消息显示,GDDR7显存价格出现了明显上涨,单颗2GB显存价格上涨接近20美元。按8GB显存规格计算,一张显卡的显存成本或将增加约542
OpenAI加入签署AI开源模型公开信,组织达35家
7月25日,微软、英伟达等25家美国公司联署公开信支持开放权重AI模型,随后签署方增至35家,新增包括OpenAI等。开放权重模型可下载、修改、运行,能扩大创新、强化竞争并降低风险,避免AI收益集中于少数巨头。
- 热门数据榜
相关攻略
2026-07-25 21:58
2026-07-25 21:58
2026-07-25 21:58
2026-07-25 21:58
2026-07-25 21:28
2026-07-25 21:27
2026-07-25 21:27
2026-07-25 21:27
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程

