Anthropic递归自我提升时代 LLM自我进化全景综述
截至2026年5月,Anthropic超80%合并代码由Claude生成,AI智能体已能自主提假设、运行安全实验。一篇综述提出大语言模型自我提升系统闭环框架,涵盖数据获取、筛选、模型优化、推理细化与自动评估,推动模型从被动学习转向自主持续进化。
最近,Anthropic 发布了一篇题为《When AI builds itself》的文章,其中披露的数据令人瞩目:截至 2026 年 5 月,该公司超过 80% 的合并代码已由 Claude 编写,工程师的日常代码产出直接提升了 8 倍;更引人注目的是,AI 智能体已能够自主提出假设,并运行长达数百小时的强化安全实验。

这预示着什么?AI 已开始展现自主参与下一代模型设计与开发的潜力。这种自我进化的能力,正在成为新一轮 AI 发展的核心驱动力。
图 1:大语言模型自我提升 (LLM Self-improvement) 的构想:人类只需启动系统,模型便能持续优化自身能力。
以往讨论大语言模型的未来,人们通常想到的是更大参数、更多数据、更强算力。但一个现实问题摆在面前:依赖人类监督的传统训练范式正遭遇瓶颈。高质量人工标注既昂贵又缓慢,专家反馈规模化几乎难以实现;更关键的是,当模型能力达到高等数学、复杂代码、前沿科研推理等层面时,人类的认知局限反而成为模型进化的障碍。与此同时,智能体技术日益成熟,模型已能自主生成数据、调用工具、执行代码,自动化能力显著增强。
这实际上暗示着:当前的大语言模型已具备主动参与自身迭代的基础,不再需要人类逐步指导。一场深刻的范式转变正在发生:大语言模型的发展,正从被动接受人类微调与修正,转向自主探索与持续进化。
为了深入解析这一底层逻辑,来自纽约州立大学石溪分校 Zesearch NLP Lab 的 Haoyan Yang、Jiawei Zhou 等人花费近一年时间,近日发布了一篇长达 113 页、涵盖 500 多篇前沿文献的大模型自我提升全景综述。
图 2:LLM 自我提升系统 (LLM Self-improvement system) 的闭环框架:数据获取、数据筛选、模型优化、推理细化与贯穿全程的自动评估。
论文提出了一个核心概念:「LLM 自我提升系统」(LLM Self-Improvement System)。与以往关于自我演化智能体(Self-Evolving Agents)的研究不同,本篇更聚焦于模型自身能力——关注模型如何依靠内在能力驱动整个系统持续演化,并将过去分散在数据、训练、推理、评估中的各类方法,整合成一个由模型能力驱动的系统级闭环生命周期。
在该框架中,自我提升不再是单一算法,而是一套能够持续运转的智能系统。整篇论文围绕一个核心问题展开:如何在不同阶段利用模型自身能力,推动持续且自主的改进?
论文将这一系统概括为四个核心环节:数据获取(Data Acquisition)→ 数据筛选(Data Selection)→ 模型优化(Model Optimization)→ 推理细化(Inference Refinement),并由自动评估(Autonomous Evaluation)作为贯穿全程的控制层。每个环节的核心都是模型的自动化能力,使模型能够主动获取数据、筛选样本、优化自身,甚至在推理过程中反思改进。
数据获取(Data Acquisition)
图 3:数据获取 (Data Acquisition) 的三种主要路径:静态筛选、环境交互与合成生成。
自我提升的第一步是获取源源不断的学习数据。论文将数据获取分为三类:静态筛选(Static Curation)、环境交互(Environment Interaction)和合成生成(Synthetic Generation)。
静态筛选是从现有语料中挖掘可学习的样本;环境交互是让模型与外部环境互动以主动获取数据;合成生成则更进一步——让模型自行构造新的训练数据。这三类方式层层递进,模型从使用已有数据走向主动探索,甚至自主创造数据。
数据筛选(Data Selection)
图 4:数据筛选(Data Selection)的两类核心机制:模型引导评分与自适应选择。
数据获取后,下一个问题是如何识别真正有价值的数据。低质量、重复或错误的数据不仅无益,还可能放大偏差、引发模型坍塌。因此,系统必须筛选出更有效的样本,再送入下一步训练。
论文将数据筛选方法分为两类:第一类是模型引导评分(Model-Guided Scoring),利用模型自身产生的信号——如置信度、困惑度、梯度或损失函数——对数据进行评分过滤;第二类是自适应选择(Adaptive Selection),将数据筛选转化为可学习的策略,根据模型能力和反馈动态更新,每次只选取当前最有价值的数据。
模型优化(Model Optimization)
图 5:模型优化 (Model Optimization) 的 GRO 框架,通过生成、奖励与优化循环推动模型能力持续提升。
数据经过获取和筛选后,便进入将数据转化为模型能力的关键环节。作者将其总结为 GRO 框架:生成—奖励—优化(Generation–Reward–Optimization)。模型先基于已有数据生成反映当前能力的输出,再用奖励信号判断质量,最后通过训练更新自身参数,循环迭代,持续提升。
在这个 GRO 循环中,生成(Generation)是起点:模型基于当前能力产生答案、推理链等。论文将其分为三类:自我探索(Self-Exploratory Generation)让模型尝试生成多种可能解;精炼生成(Refined Generation)让模型在初始输出基础上反思和修改;交互式生成(Interactive Generation)则通过工具、环境或外部反馈不断调整生成过程。
接下来是奖励(Reward)阶段:系统对生成结果进行自动评估,判断哪些输出值得学习。奖励信号主要有三类:启发式奖励(Heuristic Reward)依赖规则或简单指标,模型奖励(Model-based Reward)由模型或奖励模型打分,可验证奖励(Verifiable Reward)则通过代码执行、答案匹配或形式化检查等方式提供更可靠的反馈。
最后是优化(Optimization)阶段:模型利用这些反馈更新自身参数。优化方法分为三类:监督微调(SFT)将高质量输出作为训练数据;强化学习(RL)根据奖励信号直接优化模型行为;混合优化(Hybrid Optimization)则将 SFT 和 RL 结合——先用高质量数据做监督学习,再通过奖励信号进一步强化。
此外,作者还总结了三种常见的模型优化范式,可视为 GRO 框架在具体方法中的不同实例:迭代拒绝采样(Iterative Rejection Sampling)、自我验证与精炼(Self-Verification and Self-Refinement)、自我对弈(Self-Play)。
迭代拒绝采样是让模型先生成多个候选答案,再用规则或模型打分筛选出高质量样本,最后用这些样本进行监督微调。自我验证与精炼则是先生成初始答案,然后自我检查、修改,最后用改进后的答案进行监督微调,或将修改前后的答案构造成偏好对进行偏好优化。自我对弈则通过模型自身或多个模型之间的竞争与合作,生成更具挑战性的样本,借助胜负、偏好或验证信号来更新模型。
推理细化(Inference Refinement)
图 6:推理细化 (Inference Refinement) 的四类方法:解码策略、推理式增强、智能体系统增强与测试时训练。
模型优化之后,另一个问题随之而来:模型能力在实际推理中能否进一步提升?模型优化关注通过训练更新参数,而推理细化(Inference Refinement)关注的是:在参数不一定永久改变的情况下,如何让模型在回答问题过程中更好地搜索、反思、调用工具并修正自身输出。
论文将推理细化归纳为四类方法。第一类是解码策略(Decoding Strategies),通过采样、树搜索、logit 调整和效率优化等方式,引导模型生成更可靠的答案。第二类是推理式增强(Reasoning-based Improvement),让模型在生成过程中加入执行、反馈、反思和协作推理,不断修正中间步骤。第三类是智能体系统增强(Agentic System-based Improvement),通过提示词、工具、记忆模块和工作流,将模型置于更完整的任务系统中以提升表现。第四类是测试时训练(Test-Time Training),模型面对具体问题时,利用当前任务产生的反馈进行临时更新,再生成最终答案。
这部分的核心意义在于,它将自我提升扩展到了推理过程中,使系统不再仅依赖训练后的参数更新,也能在具体任务中实现动态改进。这也是当前「自我演化智能体」研究最关注的方向之一:智能体如何在运行时通过规划、反思、工具调用和环境交互,不断调整自身行为并提升任务完成能力。
自动评估(Autonomous Evaluation)
图 7:自动评估(Autonomous Evaluation)通过动态基准和交互环境评估,持续监控自我提升系统的真实进步。
除了上述四个环节,自我提升系统还需要一个贯穿全程的控制层:自动评估(Autonomous Evaluation)。如果没有评估,系统根本无法判断自身的改进是否真实有效。作者强调,评估不能仅依赖人工检查或固定测试集,而应能随模型迭代自动更新并提供反馈。
为此,论文重点提出了两类方法:动态基准(Dynamic Benchmarking)可以持续生成或更新测试任务,避免静态基准失效;交互环境评估(Interactive Environment Evaluation)则让模型在真实或模拟环境中完成任务,根据环境反馈自动判断表现。
这样一来,评估不再是闭环末端的一次性打分,而是持续指导系统改进的反馈机制。
风险、应用与未来(Application, Challenge and Future Outlook)
图 8:自我提升系统的六大挑战:数据自噬、反馈信号缺陷、优化驱动失败、无效自我精炼、评估瓶颈和监督瓶颈。
自我提升系统潜力巨大,但也面临诸多挑战。作者共总结了六个关键问题:模型反复学习自己生成的数据可能导致数据自噬(Data Autophagy);错误或有偏的反馈会造成反馈信号缺陷(Flawed Feedback Signals);训练和优化过程可能出现优化驱动失败(Optimization-Driven Failures);推理阶段的自我精炼有时仅表面修改,形成无效自我精炼(Ineffective Self-Refinement);此外,评估瓶颈(Evaluation Bottlenecks)和监督瓶颈(Supervision Bottlenecks)也会限制系统的可靠发展。
图 9:自我提升系统的六大应用场景:代码、数学、医疗、金融、算法发现和科学研究。
与此同时,作者总结了六个核心应用场景:代码(Code)、数学(Math)、医疗(Medicine)、金融(Finance)、算法发现(Algorithm)和科学研究(Science)。这些领域中已有不少自我提升的实际案例,展现出这一方向的价值。
面向未来,作者提出了自我提升研究的四大方向:
第一,从模型级优化走向端到端自我提升系统(End-to-End Self-Improving Systems);
第二,发展面向应用的专用自我提升模型(Application-Centric Self-Improved Models);
第三,建立统一基准与自主评估(Unified Benchmarks and Autonomous Evaluation),衡量模型是否真正在持续进步;
第四,在自动化与人类监督之间取得平衡(Balancing Automation and Human Oversight),确保系统既能自主进化,又保持安全可控。
总体来看,这篇论文将自我提升从一组分散的技术方法提升为一个以模型为主体的系统级闭环框架。通过数据、训练、推理和评估等环节的协同,大模型从一次性训练的产物,正逐步走向能够持续成长的闭环智能系统。
当人类不再总能继续教模型时,谁来推动模型进步?答案也许是模型自己。
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:Anthropic递归自我提升时代 LLM自我进化全景综述要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点WordPress生态里从来不缺各种各样的插件和主题,但真正把焦点放在低成本营销工具上的,其实不算多。wptao就是专门做这件事的——它专注WordPress插件与主题开发,提供的工具包括WordPress连接微博、微信机器人、淘宝客插件等。对于需要轻量级获客方案的用户来说,这类产品倒是很对胃口。
360站长平台助力网站运营者监控360搜索抓取记录、收录数量及问题页面,同时提供搜索优化知识与实用建议,便于边用边学,提升站点表现。
JobGenie面向求职者与招聘方,智能生成基于职位描述的个性化面试问题,并能快速创建全面职位描述,旨在通过AI自动化解放人力,让招聘者聚焦核心判断,大幅提升招聘与面试效率。
百度站长社区是官方为站长搭建的学习交流平台,提供权威运营技巧、算法解读与行业经验分享,内容涵盖收录、优化等日常问题,信息实用接地气,旨在帮助站长解决站点优化难题,提升网站表现,获取官方一手资讯。
- 日榜
- 周榜
- 月榜
热点快看
