企业调用大模型正在从"个人试用"变成"业务系统7x24小时调用API"。调用规模在涨,模型数量在增,使用人数在扩。随之而来的问题是:多张供应商账单无法核对,调用日志散落在不同系统,部门预算没有管控手段,监管要求调用可追溯。

这些问题的工程解法,叫AI网关。

AI网关的定义


AI网关是专门面向大模型服务的流量治理组件,位于企业AI应用与底层模型服务之间。它与传统API网关的差异在于处理对象:传统API网关管理RESTful请求的接口路由和限流;AI网关管理大模型调用的Token计量、模型路由、提示词安全、语义缓存和调用审计。

大模型调用的技术特征与普通API请求差异显著。长连接、大带宽、高延时是基本属性。Token按量计费,不同供应商的计费单价和计量方式不同。输出内容不可预测,可能包含敏感信息或违规内容。这些特性使传统API网关的限流和路由策略不适用,需要专用组件处理。

MAI Gateway是魔芋推出的企业级AI网关,产品定位是企业大模型API的统一入口和治理层,不同于大模型MaaS平台,实际位于MaaS平台的上游——企业应用连接网关,网关再连接模型供应商。所有调用的身份校验、配额检查、安全处理、路由选择、费用记录和日志留存,都在网关层完成。

魔芋AI大模型网关I全球大模型一站式调用及服务平台魔芋AI大模型聚合平台(大模型网关平台)专注于提供高效能、低成本的多品类 AI 模型服务,助力开发者和企业聚焦产品创新。https://www.moyu.info/register?aff=zFsq

企业AI流量治理的六个维度


统一接入与协议转换
企业同时使用多个模型供应商时,每个供应商有自己的API格式、认证方式和计费规则。业务系统直接对接多个供应商,需要适配多套协议,模型更换时需要逐个修改连接信息。

MAI Gateway的大模型管理页面显示已接入517个模型。每个模型在统一目录中记录名称、供应商、状态和调用入口。对于兼容OpenAI接口规范的应用,接入方式是替换Base URL和API Key。网关层完成协议转换,业务系统不感知供应商差异。不同供应商的API格式差异在网关层被抹平。

请求进入网关后,下一步是选择上游模型链路。

智能路由与故障切换
当某个模型供应商服务不可用时,直连该供应商的业务系统会直接停摆。调用经过网关时,路由规则检测到链路不可用后,自动切换到备用模型。

MAI Gateway支持三种路由模式:默认路由按权重分配供应商流量;主备路由在主链路异常时切换备用服务;成本路由将符合条件的任务分配给费用较低的模型。系统定期检查链路状态,链路超过延迟阈值、连续报错或不可用时临时下线,恢复后重新加入路由。

链路确定后,请求内容在发送到模型供应商之前需要经过安全处理。

安全防护
企业调用外部模型时,输入内容可能包含身份证号、银行卡号等敏感信息。请求到达模型供应商之前,这些字段需要被处理。

MAI Gateway的安全管理包含四个子模块:访问控制(令牌鉴权、IP黑白名单)、输入防护(提示词注入检测)、输出过滤(返回内容审核)、数据脱敏(8条正则规则,覆盖身份证、银行卡、军官证、手机号等,按高/中/低三级风险分级)。外部模型密钥由网关集中保管,内部应用使用企业分配的受控令牌,不直接接触供应商密钥。传输链路可使用TLS加密。

安全处理完成后,请求到达模型供应商并返回结果。这次调用消耗了多少Token、产生多少费用,需要在网关层记录和计量。

Token计量与成本管控
大模型按Token计费,但Token消耗对业务系统是黑盒。企业看到的是月底供应商账单总额,无法拆分到部门、项目或个人。

MAI Gateway的消费总览页面提供四张KPI卡片:本月消费、今日消费、本月Token消耗、预计月消费——基于当前趋势实时推算月底总费用。成本优化页面列出高耗用户排名和归因分析,按供应商拆分消费占比,给出优化建议:同一模型不同供应商链路价格不同,切换供应商可降低成本。

FinAPI是MAI Gateway中的AI费用管理框架,将成本管理分为三个阶段:统一管理(收口分散的模型采购和调用)、成本审计(预算核对、异常识别、费用归因)、成本优化(根据业务效果调整路由和模型选择)。

计量结果反过来驱动配额执行——预算和Token数据决定了下一次调用是否被放行。

配额与流量控制
部分供应商已引入分时定价,高峰时段调用成本可能是空闲时段的两倍。没有配额管控,部门预算在价格波动时直接失控。

MAI Gateway的配额管理支持按企业、组织、部门、项目、用户、令牌或模型设置,周期可按日、周或月计算,控制指标包括金额、Token数量、请求频率和并发数。额度接近阈值时发送告警,超限后执行限速、阻断、临时扩容或模型降级。交互式办公应用可设置较低并发和稳定速率,批量任务安排在指定时段运行,自动化智能体可单独配置RPM、TPM和最大费用,避免循环调用或异常重试持续消耗资源。

每一次经过配额检查的调用,无论放行还是阻断,都会进入日志审计环节。

日志审计与调用留痕
监管机构在检查企业AI使用时,要求提供"谁在什么时间用了哪个模型"的证据。AI生成内容可追溯已成为合规要求。这些要求落到工程层面,就是调用日志。

MAI Gateway的日志审计页面有110,946条API请求记录。每条记录包含10个字段:时间(毫秒级)、所属令牌、所属供应商、模型、部门/项目、总Token、金额、请求内容、响应内容、操作。搜索栏支持按Trace ID、令牌、用户、模型名、状态、日期范围筛选。告警可由模型不可用、调用量突增、预算超限、令牌异常或内容安全事件触发,通过邮件、钉钉、飞书等渠道通知相关人员。

六个维度怎么形成闭环


一次大模型调用在MAI Gateway中的完整路径是:请求通过统一接入进入网关,智能调度层选择上游链路,安全处理层检测和脱敏请求内容,Token计量层记录费用,配额管控层判断是否放行,日志审计层留存调用记录。六个环节顺序执行,每个环节的输出是下一个环节的输入。

这个链条不是单向的。日志审计的数据反过来驱动其他五个环节的调整:审计发现高耗用户,成本优化页面给出供应商择优建议,配额规则随之收紧;审计发现某条链路延迟上升,路由权重随之调整;审计发现敏感信息命中脱敏规则,安全策略随之加强。计量数据驱动配额执行,配额执行产生新的调用记录,调用记录进入审计,审计结论反过来修正计量和配额规则。六个维度形成调用治理的反馈闭环。

MAI Gateway的典型应用场景包括七类:多团队多模型统一接入、自动化智能体异常消耗治理、财务分账与月度对账、敏感数据调用外部模型、公共模型与本地算力混合使用、AI编程与研发平台、企业内容生成。这些场景的共同前提是:企业的大模型调用涉及多供应商、多部门、多场景,调用入口、权限、计费、安全和审计需要在一个工程层里统一管理。

企业AI流量治理的闭环,从请求进入网关开始,到审计数据反馈回策略调整结束。MAI Gateway是这个闭环的工程实现。如果你也在考虑企业AI落地,欢迎联系我们咨询更多讯息!

Logo

欢迎加入 MCP 技术社区!与志同道合者携手前行,一同解锁 MCP 技术的无限可能!

更多推荐