自大语言模型(LLM)展现出通用推理能力以来,研究者致力于将其转化为具备自主行动能力的智能体(Intelligent Agent)。这一转型依赖于一系列协同演进的技术组件,其发展呈现出清晰的阶段性特征。

2023年:执行能力的初步探索——Function Call

OpenAIGPT-4 发布中引入 Function Calling 机制(OpenAI, 2023),允许模型在生成文本时请求调用预定义外部函数。此举首次打通“推理—执行”链路,但其实现封闭、静态注册、缺乏上下文传递,难以支撑复杂或动态任务。

2024年:工作流抽象与协议奠基

面对多步任务需求,社区转向结构化编排。LangChain 团队于 2024 年推出 LangGraph,将智能体行为建模为状态图,支持循环、分支与中间状态持久化,使复杂推理链可编程、可观测。同年 11 月,Anthropic 开源 Model Context Protocol(MCP),定义模型与工具间的通用通信标准(Anthropic, 2024)。MCP 支持动态工具发现、上下文感知调用与权限控制,为跨平台工具集成奠定基础,被业界视为“AI 的 USB-C 接口”。

2025年:记忆、反思与安全执行

随着执行能力增强,系统需更高级的认知与保障机制:

  • Memory ArchitectureMemGPTStanford, 2024)及后续工作提出分层记忆模型,区分工作记忆与长期经验;
  • ReflectionReflexion 框架(Johns Hopkins et al., 2025)引入自我评估与策略修正,提升任务鲁棒性;
  • Sandboxed Execution:工业界普遍采用容器或 WASM 隔离 Agent 执行环境(如 Microsoft AutoGen Studio Runtime, 2025),确保安全性。

2025年末至2026年初:技能生态爆发

Anthropic202510 月随 Claude Computer Use 功能正式提出(Anthropic, 2025)。Skills 将专业操作(如“处理报销单”“剪辑视频”)封装为标准化、可复用的指令包(通常以 SKILL.md 形式描述),其价值高度依赖两大前提:

  • 底层执行能力Computer Use 首次赋予模型操作图形界面的能力;
  • 标准化通道MCP 提供统一接口,使 Skills 可被任意兼容 Agent 发现与调用。

2025–2026:协作与运行时抽象

单体 Agent 能力逼近瓶颈,Agent-to-Agent(A2A) 通信成为焦点(AutoGen, 2024CrewAI, 2025),支持任务分解与群体智能。同时,Human-in-the-Loop 编排强调人在关键节点的介入。更进一步,Agent OS / Agent Runtime 概念兴起(Stanford AgentOS, 2025Anthropic Agent Platform, 2025),试图整合调度、通信、记忆与安全,构建“智能体的操作系统”。

Logo

欢迎加入 MCP 技术社区!与志同道合者携手前行,一同解锁 MCP 技术的无限可能!

更多推荐