转写说明
本文基于已校验的公开原文进行结构化转写与事实梳理,非原文转载。 转写保留可核验的技术事实,并将工程建议与来源观点明确分开。
- 原作者: 阿里云云原生
- 原始来源: https://juejin.cn/post/7670829328368582690
- 原文发布时间: Fri, 07 Aug 2026 02:59:26 GMT
核心结论
阿里云AI网关Serverless新版已完成架构升级,提供统一流量入口能力。该版本支持接入LLM API、Agent API和MCP Server,集成了路由、认证、限流、安全防护和用量观测功能。新版分为标准版和企业版两种形态:标准版0元起步、按用量付费,企业版提供独立入口和更高服务等级。核心能力包括AI Fallback自动切换备用模型,以及基于拓扑图的Agent统一管理界面。公测期为7月31日至8月31日,地域覆盖北京、上海、杭州、深圳、香港。
能力机制
AI网关在AI应用链路中位于两个位置:外部流量进入Agent时的入口,以及Agent访问模型时的出口。
AI Fallback机制针对三类场景自动触发备用模型调用:后端返回任意4xx或5xx状态码;流式场景下首个响应包超过设定时间未到达;网关侧限流或拦截时触发。Model API可配置一至多个Fallback模型,网关按预设顺序依次调用,形成多级降级链路。首包响应超时阈值单位为毫秒,设为0表示不启用该条件。配置变更在控制台完成,无需修改应用代码。
Agent管理将外部业务访问Agent与Agent访问模型两条链路收敛为同一资源。控制台左侧配置外部访问的域名、路由和消费者认证;右侧配置Agent通过网关调用模型的链路。调用量、错误率、Token消耗和请求日志按Agent维度聚合展示。
智能路由功能先在实例型独享版上线,Serverless版本随后推出。该功能将模型名替换为auto/<模式>即可启用,提供四种路由模式:综合均衡、成本优先、速度优先、质量优先。多轮对话和Agent工具链场景下保持同一任务内模型稳定,仅在新任务开始时重新选择。
快速开始
新版开通入口位于阿里云控制台搜索“AI网关”。标准版开通无需支付实例费用,按实际用量计费;企业版需支付实例费加按量费用。
创建Agent流程:首先在Agent管理页面创建资源,填写名称并选择Agent类型,支持百炼、AgentTeams、Dify、Claude Code和自定义等类型;创建完成后进入Agent拓扑页分别配置外部访问和模型访问链路。
配置AI Fallback时,在Model API设置中开启Fallback开关,从服务列表选择备用服务。模型名称默认透传至备用模型,也可手动指定具体模型名称。
环境变量名称由网关平台统一分配,用于API调用时的身份认证,具体名称需在控制台获取。
适用边界
公测期间AI网关Serverless新版自身费用不收费,仅公网流量按CDT(云数据传输)计费。模型服务、日志服务等其他云产品费用按各自产品规则收取。
标准版服务等级为99.9%,企业版服务等级为99.95%。标准版定位小规模生产和低流量业务,提供平台分配的访问入口;企业版面向正式生产和规模化业务,支持独立入口、自定义域名和自定义证书。
智能路由功能需注意上线节奏:先在实例型独享版上线,Serverless版本推出时间待定。
已有原Serverless实例的用户可继续使用原版本,新开通建议优先选择新版。功能可用范围、地域、价格、服务等级、Agent类型、模型档位和实例规格均以产品控制台和官网价格页展示为准。
核验清单
确认以下信息可通过官方渠道核验:公测时间为2024年7月31日至8月31日;公测地域包含北京、上海、杭州、深圳、香港五个区域;标准版起步成本为0元,无实例费用;企业版需支付实例费加按量费用。服务等级方面,标准版承诺99.9%,企业版承诺99.95%。支持的Agent类型包括百炼、AgentTeams、Dify、Claude Code和自定义类型。智能路由提供的模式选项为综合均衡、成本优先、速度优先、质量优先四种。AI Fallback触发条件涵盖后端4xx/5xx错误、首包响应超时、网关侧限流或拦截三类场景。候选模型池支持平台内置模型和用户自有模型两种来源。
来源与核验
- 原始文章
- 页面事实以原始来源及其引用的官方资料为准;版本、星标和模型能力会随时间变化。
- AI Stack 不公开抓取到的全文快照,只发布独立转写与来源入口。