写在最前面

面向基础模型编程的时代

现代 AI Agent 已从单一功能模块演进为"感知→决策→工具→记忆→执行→协作→学习"的完整闭环系统,具备自主性、适应性、泛化能力和持续进化能力,是面向基础模型编程时代的核心范式。


1、AI Agent 概念

1.1、什么是 Agent

AI Agent(人工智能代理) 是一种能够感知环境、做出决策并采取行动的人工实体。

  • 哲学领域:指具有欲望、信念、意图和行动能力的实体(如人类或动物)
  • 人工智能领域:特指计算实体,通过传感器感知环境,通过执行器执行动作,展现出自主性、反应性、主动性和社会性等特性

基于大语言模型(LLM)的 Agent 利用 LLM 作为"大脑",赋予其更强的推理、规划和自然语言交互能力,使其能够处理复杂任务,如对话、工具使用和环境交互。

tips:OpenAI 研究主管 Lilian Weng 提出的定义

OpenAI的研究主管Lilian Weng提出的(传送门:LLM Powered Autonomous Agents),Agent = 大模型(LLM)+ 规划(Planning)+ 记忆(Memory)+ 工具使用(Tool Use)。

在 LLM 驱动的自主代理系统中,LLM 充当代理的大脑,并辅以规划、记忆和工具使用这几个关键组件构成的集合体就是 Agent。
在这里插入图片描述

tips:复旦大学 NLP 团队提出的定义

复旦大学NLP团队则提出(传送门:The Rise and Potential of Large Language Model Based Agents),Agent = 大脑 + 感知 + 行动。

  • 大脑:作为控制器承担记忆、思考和决策等任务
  • 感知:从外部或者内部感知并处理多模态信息
  • 行动:通过工具执行任务的结果来输出给感知,进而影响大脑决策,周而复始
    在这里插入图片描述


无论是Lilian Weng提出的Agent定义,还是复旦大学NLP团队提出的Agent定义。简言之,基于大语言模型的Agent,就是让大模型“代理或者模拟”人的行为,然后使用“工具或者功能”来完成某些“任务”的能力。所以Agent(代理)就是代表让大模型调用工具或功能帮人完成某些事情的过程,只要符合这个定义那它就是一种Agent。
在这里插入图片描述

1.2、对比传统应用

传统应用通过硬编码或者 SOP/流程编排平台同样可以实现类似 Agent 的流程功能,Agent 能做的事情,之前传统的业务系统也能做,二者关键差异在于

维度 传统应用 AI Agent
自主性与适应性 依赖预定义规则和固定逻辑 具有自主性,能动态适应新环境,通过 LLM 推理处理未知任务
灵活性与泛化能力 局限于特定领域 利用 LLM 泛化能力,处理多模态输入输出,可调用外部工具解决复杂问题
学习与交互 静态无学习,需重新部署更新 支持持续学习,通过记忆和反馈机制从人类反馈中改进行为
社会性与协作 多是孤立系统 能与其他 Agent 或人类协作,形成多 Agent 系统协同处理任务

2、AI Agent 方法论

AI Agent 作为大语言模型(LLM)的"行动延伸",其核心组件已从早期的"感知 - 决策 - 执行"简单框架,演变为多模块协同、支持自主学习与多智能体协作的复杂系统。其迭代方向可以归纳为以下四类:多模态与场景适配、分层与闭环、自主进化、多智能体协作。

2.1、感知模块:多模态输入与环境交互的"入口"

感知模块是AI Agent接收外部信息的“感官”,负责将用户或环境的多模态数据(文本、图像、音频、视频、传感器信号等)转化为可处理的结构化信息,其形式包括:

  • 多模态输入处理:支持文本、图像、音频的融合感知,例如百度智能云的“多模态智能体”可接收用户的语音指令(音频)、上传的图片(图像)和文字描述(文本),统一转化为LLM可理解的向量表示。
  • 环境感知扩展:在工业、物流等场景中,感知模块可接入传感器数据(如温度、湿度、设备状态),实现对物理环境的实时监控。例如捷瑞数字的“工厂智能体”通过感知模块接收车间传感器的温度、压力数据,支撑生产调度决策。
  • 上下文感知:通过记忆模块关联历史交互信息,实现“语境化感知”。例如蚂蚁集团的“PEER智能体框架”中,感知模块会将用户当前问题与之前的对话历史结合,提升意图理解的准确性。

2.2、决策模块:自主推理与规划的"大脑"

决策模块是AI Agent的“核心中枢”,基于LLM的推理能力,负责目标拆解、策略制定与路径规划,其形式包括:

  • 分层规划架构:将决策过程分为“战略层(目标拆解)、战术层(工具选择)、执行层(参数生成)”三层,支持复杂任务的逐步分解。例如在提前结清场景中,战略层将其拆解为查询合同信息,试算提前结清金额,办理提前结清等子任务,战术层为每个子任务匹配对应的工具(如提前结清试算、办理提前结清工具),执行层生成具体的工具调用参数。
  • 推理技术:融合思维链(CoT)、思维树(ToT)、ReAct范式(推理+行动),实现“边思考边行动”的动态决策。例如斯坦福大学的“HippoRAG模型”通过CoT技术,让Agent在生成答案前先梳理推理步骤,提升回答的准确性;ToT技术则用于多分支问题(如路径规划),生成多个可能的路径并选择最优解。
  • 反馈驱动的动态调整:支持根据环境反馈(如工具调用结果、用户评价)调整决策策略。例如百度智能云的“智能客服Agent”在回答用户问题后,会根据用户的“点赞/差评”反馈,优化后续的回答策略。

2.3、工具模块:与外部环境交互的"执行器"

工具模块是AI Agent实现“行动能力”的关键,负责调用外部工具/API完成具体任务(如数据查询、代码生成、设备控制),其形式包括:

  • 工具API编排:支持自动生成工具调用流程图,实现多工具的协同工作,协同执行将结果整合后反馈给用户。
  • 异常处理机制:具备异常熔断与备用方案切换能力,提升系统的鲁棒性。例如金融风控Agent在调用“征信查询API”时,若结果置信度低于90%,会自动触发人工复核流程。
  • 工具生态扩展:支持接入第三方API、插件、业务系统实现与企业现有系统的集成。例如字节跳动的“运维Agent”可调用“监控工具API”(检测服务器异常)、“告警系统API”(推送异常通知),实现运维自动化。

2.4、记忆模块:长期经验积累与知识存储的"仓库"

记忆模块是AI Agent实现“上下文连贯性”与“自我进化”的基础,负责存储感知信息、决策过程、行动结果等历史数据。其包括:

  • 多维记忆网络:突破传统“短期上下文窗口”的限制,形成情景记忆(具体事件)、语义记忆(知识图谱)、程序记忆(工具调用模式)、情感记忆(用户偏好)四维存储结构。例如斯坦福大学的“HippoRAG模型”通过情景记忆存储“用户之前的咨询记录”,语义记忆存储“产品知识图谱”,程序记忆存储“常用工具的调用方式”,情感记忆存储“用户的偏好(如喜欢简洁的回答)”,提升决策的准确性。
  • 长期记忆实现:通过向量数据库(如Chroma、Weaviate)实现知识的持久化存储与快速检索。例如将用户的对话历史转化为向量存储到Chroma数据库中,当用户再次提问时,快速检索相关历史信息,实现“越用越聪明”的效果。
  • 记忆反思机制:对已有记忆进行分析与提炼,改进未来的决策。例如记忆模块会反思之前执行过程中的行为和问题,然后将这些转换为规则,避免后续出现类似问题。

2.5、执行模块:闭环控制与状态管理的"引擎"

执行模块是AI Agent实现“目标落地”的关键,负责将决策结果转化为具体行动,并管理整个系统的状态。其形式包括:

  • 闭环控制流程:支持“感知-决策-执行-观察”的循环迭代,直到任务完成。例如百度智能云的“智能生产调度Agent”会持续监控车间的生产状态(观察),根据调度决策(决策)调整生产计划(执行),并接收传感器反馈的生产数据(感知),不断优化调度策略。
  • 状态管理:记录系统的当前状态(如任务进度、工具调用状态),确保执行过程的连贯性。例如在“多智能体协作”场景中,执行模块会管理每个Agent的状态(如“数据采集Agent已完成数据收集”),并向管理Agent反馈,支撑任务的协同推进。
  • 流程调度:支持工作流模板与拖拉拽式编辑,降低企业的使用门槛。例如捷瑞数字的“伏锂码AI超级智能体平台”提供丰富的工业工作流模板(如“生产计划流程”“质量检验流程”),企业可以通过拖拉拽的方式编辑流程,快速部署AI Agent。

2.6、多智能体协作组件:复杂任务的"协同平台"

随着任务复杂度的提升,多智能体系统(MAS)已成为AI Agent的重要发展方向。其核心协作组件包括:

  • 角色分工:每个Agent承担特定的角色(如“管理Agent”“数据采集Agent”“分析Agent”),实现专业分工。例如品牌监控系统中的“网页抓取Agent”(负责获取品牌提及信息)、“社交平台分析Agent”(负责判断情感倾向)、“报告撰写Agent”(负责整合结果),由管理Agent协调各Agent的工作。
  • 通信协议:采用事件驱动型通信(如Apache Kafka、RabbitMQ)或标准化协议(如MCP、A2A),实现Agent间的异步通信与协作。例如在自动驾驶车队中,车辆通过事件驱动型通信模式,发布“道路障碍物”事件,其他车辆订阅该事件并调整路线,无需中央服务器协调。
  • 协同决策:通过投票机制、评审机制或集中式管理,实现多Agent的协同决策。例如水平结构的MAS中,多个Agent平级协作,通过投票机制达成共识;垂直结构的MAS中,管理Agent负责调度子Agent,实现集中式决策。

2.7、学习与反馈模块:自我进化与优化的"动力源"

学习与反馈模块是AI Agent实现“持续进化”的核心,负责从经验中学习,提升决策与执行的准确性。其包括:

  • 强化学习(RL):通过与环境的交互(如工具调用结果、用户评价),优化决策策略。例如百度智能云的“智能客服Agent”通过强化学习,不断优化回答策略,提高用户满意度。
  • 人类反馈强化学习(RLHF):结合人类的评价(如“点赞/差评”),调整Agent的行为。例如蚂蚁集团的“PEER框架”中,RLHF模块会分析人类对Agent回答的评价,优化后续的回答生成。
  • 联邦学习(FL):在多智能体系统中,通过联邦学习实现隐私保护下的经验共享。例如多个“工厂智能体”可以通过联邦学习,共享生产调度经验,而无需暴露各自的敏感数据(如生产计划)。

一键三连,让我的信心像气球一样膨胀!

Logo

欢迎加入 MCP 技术社区!与志同道合者携手前行,一同解锁 MCP 技术的无限可能!

更多推荐