智能体应用 IaaS 基础设施需求清单
智能体应用(AI Agent)相比传统应用有一些特殊的基础设施需求,比如长时任务运行、LLM API 调用、记忆/状态持久化、工具执行环境隔离等。
本文按 IaaS 核心组件分类,梳理搭建 Agent 平台所需的基础设施资源。
1. 计算资源(Compute)
| 需求 |
推荐方案 |
说明 |
| Agent 推理服务 |
容器服务(K8s / ECS / AKS / GKE)或 Serverless(Lambda / Cloud Functions) |
Agent 逻辑通常是事件驱动的,Serverless 适合短时任务;需要长时运行或复杂编排时用 K8s |
| Tool 执行沙箱 |
隔离的容器实例 / 无服务器函数 |
Agent 调用工具(代码执行、搜索等)需要安全隔离,避免影响主服务 |
| 模型推理(私有化) |
GPU 实例(NVIDIA A100/V100)或托管推理服务 |
如果本地部署 LLM,需要 GPU 计算资源 |
| 后台任务队列 |
Worker 节点 + 任务队列 |
Agent 的复杂任务可能需要异步执行和重试机制 |
2. 存储(Storage)
| 需求 |
推荐方案 |
说明 |
| 对象存储 |
S3 / Azure Blob / GCS |
存储 Agent 上传的文件、生成的文档、日志、模型权重等 |
| 块存储 |
EBS / Azure Disk / Persistent Disk |
给数据库和需要持久化状态的计算实例使用 |
| 临时缓存 |
Redis / Memcached |
Agent 会话状态、短期记忆、速率限制缓存 |
3. 数据库(Database)
| 需求 |
推荐方案 |
说明 |
| 结构化数据 |
PostgreSQL / MySQL / Cloud SQL |
用户数据、配置、Agent 定义、任务记录 |
| 向量数据库 |
Pinecone / Weaviate / Qdrant / pgvector |
核心组件 — 用于 RAG(检索增强生成),存储知识库向量和 Agent 长期记忆 |
| 文档/NoSQL |
MongoDB / DynamoDB / Firestore |
非结构化对话历史、Agent 执行日志、灵活 schema 配置 |
| 图数据库(可选) |
Neo4j / Amazon Neptune |
如果 Agent 需要复杂的关系推理和知识图谱 |
4. 消息与队列(Messaging)
| 需求 |
推荐方案 |
说明 |
| 任务队列 |
RabbitMQ / SQS / Azure Service Bus / Pub/Sub |
Agent 任务通常是异步的,需要队列解耦和削峰填谷 |
| 流处理(可选) |
Kafka / Kinesis / Event Hubs |
实时事件驱动 Agent、多 Agent 协作的消息总线 |
| WebSocket/实时通信 |
API Gateway + Lambda/ECS |
推送 Agent 执行状态、流式输出 LLM 响应 |
5. 网络(Networking)
| 需求 |
推荐方案 |
说明 |
| 虚拟网络 |
VPC / VNet / VPC |
隔离 Agent 服务网络,配置公有/私有子网 |
| 入口网关 |
API Gateway / ALB / Nginx |
统一入口,处理认证、限流、路由 |
| 出站代理 |
NAT Gateway |
Agent 调用外部 API(OpenAI、搜索引擎等)需要受控的出站访问 |
| DNS & CDN |
Route 53 / Cloudflare / CloudFront |
域名管理,静态资源加速 |
6. 安全与身份(Security & IAM)
| 需求 |
推荐方案 |
说明 |
| 身份认证 |
IAM / OAuth 2.0 / OIDC |
用户身份、服务间身份验证 |
| 密钥管理 |
AWS KMS / Azure Key Vault / HashiCorp Vault |
极其重要 — LLM API Key、数据库密码、签名密钥必须托管在 KMS |
| 网络隔离 |
Security Groups / NACL / WAF |
限制 Agent 沙箱的网络访问,防止恶意工具执行外联 |
| 审计日志 |
CloudTrail / Azure Monitor / SIEM |
记录 Agent 行为、API 调用、权限变更 |
7. 可观测性(Observability)
| 需求 |
推荐方案 |
说明 |
| 日志 |
CloudWatch / ELK / Loki |
Agent 推理过程、工具调用链、错误追踪 |
| 指标监控 |
Prometheus + Grafana / Datadog |
LLM 延迟、Token 消耗、任务队列深度、API 限流状态 |
| 链路追踪 |
Jaeger / Zipkin / AWS X-Ray |
追踪 Agent → LLM → Tool → DB 的完整调用链 |
| LLM 可观测性(可选) |
LangSmith / Langfuse / Weights & Biases |
专门追踪 Agent 执行步骤、Token 成本、提示词版本 |
8. 特殊:Agent 运行环境(Agent-Specific)
| 需求 |
推荐方案 |
说明 |
| 代码执行沙箱 |
E2B / Modal / 自研 Firecracker microVM |
Agent 运行用户代码时需要安全隔离环境 |
| 浏览器自动化 |
Selenium Grid / Playwright + 无头浏览器容器 |
Agent 需要网页浏览能力时的基础设施 |
| 模型网关(可选) |
LiteLLM / Langfuse Gateway |
统一路由多个 LLM Provider,做限流、Fallback、成本统计 |
典型最小化架构
┌─────────────┐ ┌─────────────┐ ┌─────────────────┐
│ 用户端 │────▶│ API Gateway │────▶│ Agent 服务集群 │
└─────────────┘ │ + WAF │ │ (K8s/ECS) │
└─────────────┘ └────────┬────────┘
│
┌─────────────┐ ┌────────▼────────┐
│ 对象存储 │◀────│ Tool 沙箱 │
│ (S3) │ │ (隔离容器/Serverless)
└─────────────┘ └─────────────────┘
▲ │
│ ┌──────────▼──────────┐
┌──────┴──────┐ │ LLM API / 私有模型 │
│ 向量数据库 │ │ (OpenAI/Claude等) │
│ (Pinecone) │ └─────────────────────┘
└─────────────┘
▲
┌──────┴──────┐
│ PostgreSQL │
│ + pgvector │
└─────────────┘
建设优先级建议
第一阶段:必须有
- 计算(容器 / Serverless)
- PostgreSQL + pgvector
- 对象存储
- Redis
- API Gateway
- KMS 密钥管理
第二阶段:强烈建议
- 任务队列(SQS / RabbitMQ)
- 日志与监控系统
- 链路追踪
- IAM 细粒度权限
第三阶段:按规模添加
- 专用向量数据库(Pinecone / Weaviate)
- 模型网关(LiteLLM)
- 代码执行沙箱(E2B / Modal)
- 多区域部署与容灾
本文档基于云原生架构最佳实践整理,具体服务选型可根据实际使用的云厂商(AWS / Azure / GCP / 阿里云 / 腾讯云)调整。
所有评论(0)