面包屑图标 当前位置: 首页
AI资讯
热点详情

AI Agent是什么?5W1H框架深度解析

AI热点日报
AI热点日报时间:2026-06-23
热点解读

AIAgent是以大语言模型为核心的自主系统,由规划、记忆和工具三部分组成,能分解任务、反思完善、调用API。其优势在于任务导向、自然交互和灵活适应,但存在可靠性不足、法律风险和成本问题。企业和个人应关注其在供应链、研发等环节的效率提升。

导言

大佬们都在关注的AI Agent,到底是什么?用5W1H分析框架拆解AI Agent(上篇)

大模型的横空出世,重新点燃了市场对AI的热情。而AI Agent这个概念,更是将这股热潮推向了新的高度。从去年开始,AI Agent就成了炙手可热的名词,其热度丝毫不亚于大模型本身,甚至一众大佬纷纷为其站台。

2023年下半年,OpenAI联合创始人、前Tesla AI总监Andrej Karpathy曾表示:如果一篇论文提出某种不同的训练方法,OpenAI内部会嗤之以鼻,认为都是自己玩剩下的;但当新的AI Agents论文出来时,他们会十分认真且兴奋地讨论。普通人、创业者和极客在构建AI Agents方面相比OpenAI这样的公司更有优势。

在AI Ascent 2024大会上,斯坦福大学教授、前谷歌大脑项目创始人吴恩达分享了关于AI Agent的最新趋势与洞察:AI Agent工作流将在今年推动人工智能取得巨大进步——甚至可能超过下一代基础模型。这是一个重要的、令人兴奋的趋势,他呼吁所有人工智能从业者都关注它。

微软创始人比尔·盖茨也通过个人网站发表看法:AI Agent将成为下一个平台,简而言之,它几乎将在任何活动和生活领域提供帮助,对软件行业和社会产生深远影响。

趁着这波浪潮,短短一年时间内,AI Agent领域的创业公司和独角兽实现了爆发式增长。早在去年3月,AutoGPT就在GitHub上获得了7.4万星,并快速成为史上Star数量增长最快的开源项目,如今已超过16万星。后续发布的BabyAGI、AgentGPT也如雨后春笋般涌现,调研报告、订购披萨、发送邮件、旅行攻略——无数Agent应用场景纷纷开始落地。

在国内,AI Agent相关产品也相继诞生。去年7月,阿里云发布了旗下第一个智能体——ModelScopeGPT,面向开发者群体。随后百度文心智能体平台、字节Coze、腾讯元器,各大厂商的AI智能体平台也纷至沓来。

面对如此巨大的热潮,相信很多读者在心潮澎湃的同时,也会心存疑虑:AI Agent到底是什么?是真正的科技突破还是科技泡沫?对企业和个人能带来什么影响?

接下来,我们将使用5W1H分析框架来详细拆解AI Agent,一步步带大家了解其全貌。由于内容较多,本文将通过三篇文章逐步阐述全部内容。

上篇:介绍What + Why,主要解答以下问题。

What:AI Agent是什么?有哪些组成部分?原理是什么?怎么分类?
Why:为什么会产生AI Agent?优势和劣势是什么?为什么企业和个人都要关注?

中篇:介绍When + Where + Who,主要解答以下问题。
When:AI Agent的发展历程是怎样的?未来发展趋势?
Where:有哪些应用场景?
Who:有哪些玩家?行业价值链是怎样的?

下篇:介绍How,主要解答以下问题。
How:如何实现AI Agent?包括哪些系统模块?如何开始学习?

下面正式开始5W1H框架对AI Agent的拆解之旅!

一. 5W1H分析框架之What

1.1 AI Agent到底是什么?

从概念上来说,AI Agent(智能体)是一种不需要持续人类干预的AI系统,可以基于环境和背景信息,自主分析问题、做出逻辑决策,并在没有持续人类输入的情况下处理多种任务。

AlphaGo就是一个典型代表——它可以在围棋对弈中根据棋局和对手行动,自主决策下一步。AI助手也是,比如你只需下达“帮我预订明早10点上海飞深圳的机票”,它就能自动完成从搜索、查询、下单到确认的全部动作。

从结构上来说,一个AI Agent包括三个部分:

Perception(输入):通过文字输入、传感器、摄像头、麦克风等,建立对外部世界的感知。

Brain(大脑):最重要的部分,包括信息存储、记忆、知识库、规划决策系统。

Action(行动):基于Brain的决策进行下一步,主要包括对外部工具的API调用,或对物理控制组件的信号输出。

目前在大模型热潮背景下,媒体上所说的AI Agent,更严格地讲应该叫LLM Agent——因为整个Agent的核心控制中枢Brain,底层是LLM大模型。如果未来出现比LLM更强大的AI技术基座,也会产生基于新基座的Agent。下文所述AI Agent如无特殊说明,均指LLM Agent。

那么Agent和LLM大语言模型是什么关系?简单类比:如果把LLM(比如GPT)比作大脑中一堆神经元,具有记忆、常识和推理等能力,那么AI Agent就是独立的人——除了大脑,还拥有视觉、听觉、味觉等多种感官,以及手和脚来操作外部工具。

从本质来讲:AI Agent = 大语言模型 + 记忆 + 规划 + 工具使用。

接下来,逐步拆解AI Agent的组成部分。

1.2 详细拆解AI Agent的构成

1.2.1 构成一:规划(Planning)

Planning是整个AI Agent最核心的部分。Agent会把大型任务分解为子任务,规划执行流程,同时进行思考与反思,决定继续执行还是终止。

整个Planning模块包括两个步骤:子任务分解,反思和完善。

步骤一:子任务分解

Agent将大型任务拆分为更小、更易于管理的子目标,从而高效处理复杂任务。主要方式包括:思维链COT、思维树TOT、思维图GOT、规划器LLM+P。

a. 思维链COT(Chain of Thought)
当对LLM要求“think step by step”时,它会将问题分解成多个步骤,逐步思考和解决,使输出更准确。这是一种线性思维方式。

b. COT-SC
单个COT可能出错,可以尝试让Agent发散,通过多种思路解决问题,然后投票选出最佳答案。

c. 思维树TOT
对COT的进一步扩展,在每一步推理出多个分支,拓扑展开成一棵思维树。使用启发式方法评估每个分支,并用广度优先或深度优先搜索算法探索。

d. 思维图GOT
TOT对需要分解后再整合的问题(如排序)存在缺陷,可通过GOT解决。

e. LLM+P
依靠外部传统规划器进行长视野规划,利用PDDL作为中间接口描述规划问题。LLM先将问题转化为Problem PDDL,再由经典规划器生成计划,最后翻译回自然语言。

步骤二:反思和完善

在现实任务中,规划环节不可能万无一失,试错不可避免。通过自我反思和逐步完善,才能逼近最佳结果。主要方式包括:

a. ReAct(Reasoning-Action)
让大模型先思考,再行动,然后观察结果,再思考,循环往复。相比Reasoning-Only和Action-Only模式,ReAct效果更好。

b. Reflexion
为Agent配备动态记忆和自我反思能力的框架,具有标准强化学习机制。每次行动后计算启发式值,根据反思结果决定是否重置环境开始新试验。

c. Basic Reflection
利用左右互搏实现协同进化。例如设计一个市场调研Agent,Generator负责输出,Reflector负责检查,两者协同完成反思和完善。

1.2.2 构成二:记忆(Memory)

记忆是Agent获取、存储、保留和检索信息的过程。先用人脑做类比:感官记忆(几秒)、短时记忆(20-30秒,容量约7项)、长时记忆(几天到几十年,容量无限,包括显性与隐性)。

映射到AI Agent:感官记忆对应原始输入的嵌入表征(文本、图像等);短时记忆对应上下文学习(受Transformer窗口限制);长期记忆对应外部向量数据库,可快速检索引用。

还有一个关键因素:大模型知识的更新。基础大模型是用海量通用数据训练的“及格通才”,但在企业专属场景中,需要通过RAG(检索增强生成)技术挂载企业知识库,用向量数据库存储,将Agent训练为优秀专才。RAG技术非常关键,后续文章将重点介绍其原理与使用方法。

1.2.3 构成三:工具(Tooling)

为AI Agent配备工具API(如计算器、搜索工具、代码执行器、数据库查询等),使其能与物理世界交互,解决实际问题。

Agent使用工具的方式主要有:

a. TALM & ToolFormer
对LLM进行微调,以学习使用外部工具API。根据新增API调用注释是否能提高输出质量进行数据集扩展。

b. HuggingGPT = ChatGPT + HuggingFace
使用ChatGPT作为任务规划器,根据模型描述选择HuggingFace平台中的模型,并总结响应结果。

c. API-Bank
包含53种常用API工具(搜索引擎、计算器、日历查询、智能家居控制等),LLM先访问API搜索引擎找到要调用的API,再用文档调用。

d. Function Calling
通过API调用LLM时,调用方描述函数(功能、请求参数、响应参数),让LLM根据用户输入选择合适函数,并将自然语言转换为调用参数。

规划、记忆、工具,就是AI Agent系统最核心的三个模块。接下来看看分类。

1.3 AI Agent的分类

从去年开始,各类AI Agent层出不穷。合理的分类有助于理解其原理和模式。可从三个角度分类:工作模式、决策方式、应用场景。本文先介绍前两种,下一篇文章介绍“Where”时再详述应用场景。

1.3.1 按工作模式分类

单Agent:通过单一Agent解决问题,不需要与其他Agent交互。如专门用于市场分析的Agent,只能处理单一任务。

多Agent:多个Agent协同工作,相互交流信息,共同完成复杂任务。在软件开发、智能生产、企业管理等高度协同的场景中非常有帮助。例如有公司创建了多Agent系统,让Agent扮演产品经理、UI设计师、研发工程师、测试人员、项目经理等角色。

混合Agent:Agent系统与人类共同参与决策,交互合作完成任务,强调人机协作。如智慧医疗中医生与Agent共同诊断:Agent快速分析医疗记录和影像,提供初步建议;医生基于自身专业经验做最终决定。

1.3.2 按决策制定方式分类

简单反射型Agent:基于“如果-那么”规则直接响应,不存储历史数据。反应迅速但适用范围有限,如系统告警时自动拨打电话。

基于模型的反射型Agent:拥有环境内部模型,能基于理解和过往经验做出更复杂决策。如Nest智能温控器,既能根据当前温度调节,也能学习用户偏好。

基于目标的Agent:涉及对未来的考虑,从根本上不同于条件-动作规则。如智能导航根据起点、目标、交通拥堵和用户偏好输出最佳路线。

基于效用的Agent:旨在最大化效用功能,选择预期效用最高的行动。比如导航中有的用户要最短时间,有的要最少路费,系统根据不同效用给出不同结果。

学习型Agent:在未知环境中运行,从经历中学习并随时间调整行动。AlphaGo就是学习型Agent。

基于逻辑的Agent:基于逻辑规则推理解决问题,适合需要高度逻辑判断的场景,如法律咨询聊天机器人。

LLM大模型与这些Agent的关系在于:LLM为Agent的后续行动提供输入和推理。例如基于目标的Agent,会从用户输入中提取目标和要求,结合子任务分解、反思等步骤逐步完成最终目标。

二. 5W1H分析框架之Why

2.1 为什么会产生AI Agent?

为什么会产生AI Agent(特指LLM Agent)?从两方面回答:技术发展的局限性,以及人和AI的交互性。

从技术发展的局限性来看

在LLM大语言模型出现以前,一般通过规则和强化学习的方法让机器智能化地完成任务,但各有弊端。规则方法需要行业专家介入,缺乏容错能力,一个小错误就可能导致系统失败。强化学习需要大量样本训练,收集数据成本高,难以推广。

LLM出现后,人们发现它在逻辑推理、工具应用、策略规划、指令遵循等方面表现不错。工程师开始意识到,将大语言模型作为Agent的核心认知系统,可以极大地提高规划能力。但LLM还无法像人类一样深度规划思考、运用各种工具互动、拥有长期记忆。于是出现了COT/TOT/GOT、ReAct、Reflexion等技术提升Planning能力;RAG提升记忆;ToolFormer、Function Calling提升工具使用能力。

从人和AI互动的角度

主要经历了三种模式:最早是Embedding模式,人类完成大部分工作,AI作为单点能力嵌入(如OCR、人脸识别)。随着大模型出现,部分场景进化到Copilot模式,AI作为助手辅助人类(如Notion AI、微软Copilot)。而AI Agent模式将协同推至新高度——人类只提出任务和目标,由AI自主完成大部分工作。从互动角度看,AI Agent是AGI发展过程中的必经之路。

2.2 AI Agent有哪些优势和局限?

对用户来说,AI Agent的主要优势:

第一,以任务为导向。脱离传统Chatbot的闲聊模式,弥合语言理解与行动之间的鸿沟,直接基于用户意图自动推理和行动,大幅提升效率。

第二,自然的交互方式。以LLM为底座,语言理解和生成能力确保了自然无缝的用户交互。

第三,进化的决策能力。虽然还远不如人类,但这项能力在持续进化。

第四,灵活的适应性。在RAG和Function Calling等技术支撑下,可快速适应不同行业和应用场景,通过API与外部环境交互。

但LLM本身的局限也影响了AI Agent:

第一,可靠性不足。LLM容易出现幻觉和不一致性,多步骤联动会加剧问题。假设每一步可靠性95%,任务分解到5步以上,最终可靠性不到80%,限制了在关键场景的应用。

第二,法律问题。企业对外输出的Agent可能要对错误负责。例如有用户因加拿大航空聊天机器人误导而延误航班,最终由航空公司赔偿。

第三,性能和成本。GPT-4、Gemini-1.5在推理和function calling上表现不错,但速度慢、成本高,尤其需要循环调用和自动重试时。

针对可靠性问题,一个解决方案是Agentic Workflow——借助人工经验分解任务、配置执行流程,AI Agent更多承担意图识别、检索、归纳、分类的角色。例如创建财务分析报表Agent,由人类告诉它:当接收到分析某公司报表的指令时,先去某财务网站搜索、下载数据、存储、提取特定字段计算、最后输出报告。后续文章将专门介绍Agentic Workflow。

2.3 企业和个人为什么要关注AI Agent?

企业用户通常面临更复杂的业务需求,有明确的场景、逻辑以及大量行业数据和知识积累,非常适配Agent自主性、决策与执行、工具使用等特点,企业端是Agent施展能力的绝佳舞台。同时,AI Agent可以用工程化思想对抗个体工作的不确定性,过往的SOP、PDCA、OKR等管理方法可与Agent适配,完成管理工作的科学升级。

因此,企业需要关注AI Agent,结合行业特点和自身业务,在供应链、产品研发、市场营销、内部办公等环节提升效率。例如供应链环节的智能配补货、原料自动下单、库存优化、供应商协同、合同审查;产品研发环节的成分分析、新品建议、设计出图;市场营销环节的智能客服、精准推荐、创意制作、广告投放等。

再看对个人的影响。虽然目前面向C端还没有出现杀手级应用(包括OpenAI的GPTs其实只是特定知识库的Chatbot),但从长期趋势看,AI Agent一定会在越来越多场景渗透。同时,作为企业的工作者,AI Agent对个人工作效率的提升显而易见。利用AI Agent武装自己,让工作和学习效率更上一层台阶。未来可能只有两种人:驱动Agent的人,和被Agent驱动的人。

总结

本篇文章是使用5W1H分析框架拆解AI Agent的上篇,围绕What和Why,详细阐述了AI Agent的概念、构成、分类、产生原因、优势劣势以及对企业和个人的影响。

热点追踪提示词
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:AI Agent是什么?5W1H框架深度解析要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
来源:https://www.53ai.com/news/LargeLanguageModel/2024082945729.html
ai 人工智能

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关热点
AI热点2026-07-20 21:35
wptao

WordPress生态里从来不缺各种各样的插件和主题,但真正把焦点放在低成本营销工具上的,其实不算多。wptao就是专门做这件事的——它专注WordPress插件与主题开发,提供的工具包括WordPress连接微博、微信机器人、淘宝客插件等。对于需要轻量级获客方案的用户来说,这类产品倒是很对胃口。

AI热点2026-07-20 21:34
站长平台使用教程与SEO优化技巧

360站长平台助力网站运营者监控360搜索抓取记录、收录数量及问题页面,同时提供搜索优化知识与实用建议,便于边用边学,提升站点表现。

AI热点2026-07-20 21:34
JobGenie智能人力资源助手,高效招聘解决方案

JobGenie面向求职者与招聘方,智能生成基于职位描述的个性化面试问题,并能快速创建全面职位描述,旨在通过AI自动化解放人力,让招聘者聚焦核心判断,大幅提升招聘与面试效率。

AI热点2026-07-20 21:34
百度站长社区完整使用教程及实用技巧大全

百度站长社区是官方为站长搭建的学习交流平台,提供权威运营技巧、算法解读与行业经验分享,内容涵盖收录、优化等日常问题,信息实用接地气,旨在帮助站长解决站点优化难题,提升网站表现,获取官方一手资讯。

延伸阅读