AI 核心概念

一、AI (Artificial Intelligence,人工智能)

定义

人工智能是指由人制造出来的系统所表现出来的智能,通常是指通过普通计算机程序来呈现人类智能的技术。

核心范畴

  • 弱人工智能 (Narrow AI):专注于单一特定任务的AI系统,例如语音助手、图像识别工具、ChatGPT等大语言模型,是当前技术落地的主要形态。
  • 强人工智能 (General AI):具备与人类同等智能水平、能够胜任任意智力任务的AI系统,目前仍处于理论研究阶段。
  • 超人工智能 (Super AI):在所有领域都超越人类智能的AI系统,属于远期概念。

二、MCP (Model Control Protocol/Model Context Protocol,模型控制协议/模型上下文协议)

定义

MCP是一套用于标准化AI模型交互、上下文管理、权限控制的协议规范,是当前AI Agent生态的核心基础设施之一。

核心作用

  1. 上下文统一管理:提供标准化的上下文传递格式,让不同模型、不同工具之间可以无缝共享会话信息。
  2. 权限与安全控制:统一管理AI系统的访问权限、数据边界,防止敏感信息泄露和越权操作。
  3. 跨系统互操作:打破不同厂商模型、Agent系统之间的壁垒,实现AI能力的模块化组合。

应用场景

常见于多Agent协作系统、企业级AI部署、AI能力开放平台等场景,是AI从单一模型向系统级能力演进的关键协议。


三、Skills (技能)

定义

Skills是AI系统可以调用的、封装好的特定功能模块,类似于人类的"专项能力",是AI扩展能力边界的核心方式。

核心特点

  1. 模块化封装:每个Skill对应一个明确的功能,例如天气查询、文件读写、代码执行、邮件发送等。
  2. 标准化接口:遵循统一的调用规范,AI系统可以自动发现、加载和调用不同的Skill,无需定制化开发。
  3. 可组合性:多个Skill可以组合使用,完成复杂的任务,例如"查询天气+生成报告+发送邮件"的工作流。

与Agent的关系

Skill是Agent的能力组件,Agent通过调用不同的Skill来完成具体任务,Skill本身不具备自主决策能力。


四、Agent (智能体)

定义

Agent是具备自主感知、决策、行动能力的AI系统,是当前AI发展的高级形态,可以理解为"会自己思考、自己动手完成任务的AI"。

核心特征

  1. 自主性:可以在没有人类实时干预的情况下,自主规划任务路径、选择工具、完成目标。
  2. 感知能力:能够感知环境状态、用户需求、任务进展等信息。
  3. 记忆能力:具备短期会话记忆和长期知识记忆,能够基于历史信息优化决策。
  4. 工具调用能力:可以调用各类Skill、API、外部系统来完成任务。
  5. 目标导向:围绕用户给定的目标自主迭代,直到任务完成。

常见类型

  • 通用Agent:可以处理多种类型的通用任务,例如个人助理Agent、办公助理Agent。
  • 专用Agent:专注于特定领域的任务,例如代码开发Agent、数据分析Agent、客户服务Agent。
  • 多Agent系统:多个Agent分工协作,共同完成复杂任务,例如一个项目组包含产品Agent、开发Agent、测试Agent等。

五、其他核心AI相关概念

1. LLM (Large Language Model,大语言模型)

  • 定义:训练数据规模、参数规模都非常庞大的语言模型,具备理解自然语言、生成内容、逻辑推理等能力,是当前AI技术的基础底座。
  • 代表:GPT系列、Claude系列、文心一言、通义千问、豆包系列等。

2. RAG (Retrieval Augmented Generation,检索增强生成)

  • 定义:一种优化大模型输出的技术,在生成回答前先检索外部知识库,将相关信息加入上下文,让回答更准确、更符合特定场景需求,同时减少幻觉。
  • 应用场景:企业知识库问答、产品文档客服、法律/医疗专业领域问答等。

3. Fine-tuning (微调)

  • 定义:在预训练好的大模型基础上,使用特定场景的数据集进行二次训练,让模型更适配特定领域的需求。
  • 与RAG的区别:微调是"让模型学会新知识",RAG是"让模型查资料回答问题"。

4. Prompt Engineering (提示词工程)

  • 定义:通过设计和优化输入给大模型的提示词,引导大模型输出更高质量、更符合需求的结果的技术。
  • 核心原则:明确指令、提供上下文、给出示例、设定输出格式。

5. Hallucination (幻觉)

  • 定义:指大模型生成的内容看起来合理,但实际上是虚构的、不符合事实的现象,是当前大模型的主要局限性之一。
  • 解决方法:RAG检索增强、事实校验模块、工具调用验证等。

6. Token (令牌)

  • 定义:大模型处理文本的基本单位,通常1个Token对应约0.7个汉字或1个英文单词。大模型的输入输出长度限制、计费都以Token为单位。
  • 例如:"你好,世界"大约对应4个Token。

7. Context Window (上下文窗口)

  • 定义:大模型在单次会话中能够处理的最大Token长度,决定了模型可以"记住"的会话历史长度和处理长文本的能力。
  • 目前主流模型的上下文窗口从8k到1M+ Token不等。

8. Multimodal (多模态)

  • 定义:指AI系统能够同时处理和理解多种类型的信息,包括文本、图像、音频、视频等。
  • 代表:GPT-4V、Gemini、文心一言4.0等多模态大模型。

9. Alignment (对齐)

  • 定义:让AI系统的行为、输出与人类的价值观、伦理规范、需求目标保持一致的技术,是AI安全的核心研究方向。
  • 目标:确保AI"做正确的事",避免产生有害、不符合人类预期的输出。

10. Agentic Workflow (智能体工作流)

  • 定义:以Agent为核心的任务处理流程,通常包含"任务理解→规划→工具调用→结果校验→迭代优化"的闭环,相比传统的"prompt-响应"模式具备更强的复杂任务处理能力。

六、概念关系图谱

AI (人工智能)
├─ LLM (大语言模型) → 基础底座
├─ RAG/微调 → 模型优化技术
├─ MCP (协议) → 交互规范
├─ Skills (技能) → 能力组件
└─ Agent (智能体)
    ├─ 自主决策能力
    ├─ 记忆能力
    └─ 调用Skills + LLM完成任务
Logo

欢迎加入 MCP 技术社区!与志同道合者携手前行,一同解锁 MCP 技术的无限可能!

更多推荐