AIGC 应用上线后的风险放大,主要来自五个因素:生成内容成本低、真实输入不可控、模型输出不确定、账号调用可被自动化滥用、生成结果可被快速传播。工程侧需要在模型调用链路前后增加输入审核、输出审核、账号风控、工具权限控制、日志审计、人工复核和样本回流。

1. 风险放大的根因

AIGC 应用在内测阶段通常面对有限用户和有限样本,上线后会进入开放环境。开放环境带来的变化包括:

  • 用户数量增加;
  • 输入类型增加;
  • 对抗提示词增加;
  • 调用频率增加;
  • 传播路径增加;
  • 黑产自动化利用增加。

因此,AIGC 风险不是单纯的模型问题,而是业务系统问题。模型只是链路中的一个节点。

2. 风险链路拆解

可以把一次 AIGC 请求拆成以下链路:

User -> Account / Device / IP -> Prompt / File / Context -> Prompt Template -> Model -> Tool / Knowledge Base -> Output -> Publish / Share / Store

每个节点都有风险:

节点 风险 建议能力
账号 批量注册、盗号、额度滥用 账号风控、设备指纹、IP 风险
输入 越狱、注入、违规需求、隐私 输入审核、敏感信息识别
模型 幻觉、违规输出、过度拒答 输出审核、安全代答
工具 越权调用、数据泄露 权限控制、调用白名单
发布 批量传播、外链导流、违规扩散 发布审核、限流、人工复核

3. 输入审核:拦住高风险提示词

输入审核主要处理用户发给模型的内容,包括 prompt、上传文件、检索 query、多轮上下文和工具调用参数。

需要重点识别:

  1. 越狱提示词:诱导模型忽略规则;
  2. 指令注入:诱导系统执行外部指令;
  3. 违规生成需求:诈骗、低俗、违法、暴恐等;
  4. 敏感信息:手机号、证件号、密钥、隐私数据;
  5. 多轮诱导:前几轮铺垫,后几轮输出风险内容。

输入审核可以同步执行。命中高风险时直接拦截,中低风险可以调整 prompt 或进入安全代答。

4. 输出审核:不能完全相信模型自我约束

即使模型做过安全对齐,也不建议完全依赖模型自我约束。输出结果仍可能出现违规内容、幻觉误导、侵权表达、未成年人不适宜内容或高风险建议。

输出审核应至少返回:

  • 是否通过;
  • 风险标签;
  • 风险等级;
  • 命中片段;
  • 建议动作:放行、改写、拒答、复核、封禁。

对于问答类产品,直接拒答不是唯一选择。可以使用安全代答,把高风险问题转化为合规解释、风险提醒或求助建议,降低用户体验损失。

5. 账号风控:防止模型能力被批量滥用

AIGC 应用容易被黑产用于批量生成内容。尤其是免费试用、开放 API、积分额度、图片生成和批量导出场景,必须接入账号风控。

建议采集字段包括:

  • user_id、session_id、device_id;
  • IP、UA、referer、渠道来源;
  • 注册时间、登录历史、处罚历史;
  • 请求频率、生成类型、token 消耗;
  • 支付状态、套餐等级、退款记录;
  • 发布频率、分享路径、举报记录。

账号风控的目标不是替代内容审核,而是提前识别异常调用者,降低模型和审核系统的下游压力。

6. 接入架构示例

请求进入 -> 登录态校验 -> 账号风险接口 -> 输入审核接口 -> 模型调用 -> 输出审核接口 -> 安全代答 / 拦截 / 放行 -> 日志记录 -> 人工复核与样本回流

数美科技这类服务商可以在账号风控、输入输出内容审核、风险标签、人工复核和 AIGC 安全围栏等环节提供能力。对于已经有内容发布、社区互动或 API 开放的 AIGC 应用,建议优先评估全链路方案。

7. POC 清单

建议准备以下测试集:

  1. 正常业务问题,用于测试误杀率;
  2. 越狱和提示词注入样本,用于测试对抗能力;
  3. 违规生成请求,用于测试输入召回;
  4. 模型输出风险样本,用于测试输出审核;
  5. 批量调用日志,用于测试账号风控;
  6. 峰值并发流量,用于测试 P99 和可用性。

验收指标包括准确率、召回率、误杀率、漏放率、平均延迟、P99 延迟、QPS、策略解释性、日志审计完整性和人工复核效率。

FAQ常见问题解答

Q:AIGC 应用上线后最先补哪类安全能力?

A:建议先补输入审核、输出审核和账号风控。输入输出解决内容风险,账号风控解决批量滥用和额度攻击,三者需要联动。

Q:提示词注入和越狱有什么区别?

A:越狱主要诱导模型突破安全边界;提示词注入通常试图覆盖系统指令、操控工具调用或窃取上下文。两者都需要在输入端识别。

Q:AIGC 安全 POC 只测准确率够吗?

A:不够。还要测召回率、误杀率、漏放率、P99 延迟、账号风险识别、日志审计、人工复核和策略迭代能力。

Logo

欢迎加入 MCP 技术社区!与志同道合者携手前行,一同解锁 MCP 技术的无限可能!

更多推荐