
本文由 阿里云国际站代理商『翼龙云/TG Yilongcloud 撰写』如需转载请注明作者翼龙云2026年9月22日云栖大会“MaaS Agent 专题论坛”重点探讨了大模型即服务MaaS平台的标准演进、企业级智能体Agent的工程化落地及云原生基础设施支撑。阿里巴巴集团战略副总裁、ATH事业群MaaS业务线总裁文征宣布千问AI平台全面升级以推动Agent进入生产作为建设核心在模型服务基础上新增对Agent服务、行业AI解决方案的支持。一、企业级智能体落地的三大挑战论坛指出企业在应用大模型时普遍面临以下瓶颈调用受限异构模型标准不一长上下文推理的延迟难以预测。泛化能力弱简单的 Prompt 链难以应对具备动态分支的复杂业务场景。运行保障缺失涉及权限隔离、非受控代码执行及成本控制等生产级安全问题。针对这些痛点本次论坛发布了从 MaaS 治理平台到安全沙箱底座的全链路解决方案。二、千问AI平台的标准化与全链路治理千问AI平台已不再仅仅是 API 转发工具而是演进为应用运行时的关键支撑层。过去一年阿里云 MaaS 平台服务的客户数增长六倍Agent开始进入企业核心流程。1. 动态模型路由与优速模式平台以“First and Best”原则支持全球一流的自研和开放模型第一时间上线。针对Agent决策链路长、并发高、对时延敏感等特点平台通过FlashBoot、UniScheduler等能力调度异构算力将模型弹性启动时间由1200秒缩短至70秒可在1分钟内拉起1万个Pods首Token延迟降低38%Prompt Caching成本最高节省95%。本次升级的API优速模式可将TPS提升1.5至2倍用户切换model ID即可使用。平台提供99.9%生产级SLA、十亿级单客户峰值TPM和CMaaS机密推理服务支持监控、告警和成本治理。2. 上下文缓存与数据隔离为降低长文本推理成本百炼平台实现了上下文缓存Context Caching支持预加载系统Prompt与静态业务规范。命中缓存的输入Token按cached_token计费阿里云百炼部署的模型折扣比例为标准输入单价的20%即缓存命中后输入成本降低80%。在 RAG 场景下通过动态向量检索与私有化权限体系绑定确保了租户间的数据隔离。三、企业级 Agent 架构Agent Studio 与 AgentCore论坛重点剖析了 Agent 从实验 Demo 走向生产环境所需的架构能力。云栖大会正式发布了企业级全栈 Agent 服务平台Agent Studio以及Agent构建治理平台AgentCore。1. Agent Studio全栈 Agent 服务平台Agent Studio 可根据任务自动路由选择模型提供24小时不间断托管运行并支持企业内部知识数据和外部软件服务接入。在开发运行方面平台提供50多个原子API覆盖运行环境、长期记忆、工具服务、会话请求和服务端点部署等能力。全新的Agent API即将发布可将环境、记忆、工具、部署等需逐项调用的配置一次请求全部搞定。Agent Studio 还提供AutoModel能力基于Agent配置与用户Query智能路由所需模型支持隐式与显式缓存帮助降本增效。在上下文侧平台通过RAG、Memory 与 Parser X管理Agent的知识与记忆支持文档、表格、图片、音视频等多模态内容统一入库检索响应可达150ms级。2. 标准协议与人机协同工具调用方面平台支持MCPModel Context Protocol标准协议通过One Key MCP可用一个API Key连接100多项生态服务包括高德、飞猪、1688及金融、法律等各领域服务。对于转账、权限变更等高危操作AgentCore 提供安全基线约束、高风险操作审批、成本预估、操作审计等企业级保障。3. 多智能体协作与状态保持AgentCore 支持多人与多智能体的 Team 编排协作复杂任务动态拆解与调度长周期任务可中断可恢复。Agent Studio 支持 Managed Agent 托管运行开发者只需定义 Agent 业务逻辑平台提供运行、会话、事件流、密钥、环境等基础设施。四、云原生底座安全沙箱与弹性调度Agent 的高频交互对底层基础设施提出了新要求。1. 安全沙箱ACS Agent Sandbox为防范 Agent 执行代码时的安全风险阿里云推出了ACS Agent Sandbox提供MicroVM 级别隔离的运行环境支持计算、网络、存储端到端的安全强隔离。核心能力包括大规模低延迟弹性10秒内拉起5000个沙箱支撑大并发会话需求快速休眠唤醒200ms级沙箱拉起与快速休眠状态保持内存级休眠唤醒、Checkpoint 克隆能力生态兼容全面兼容 Kubernetes 原生生态无缝对接 E2B SDK、AgentScope 等主流框架Kimi 借助 ACS Agent Sandbox成功支撑了“深度研究”和“通用Agent模型OK Computer”等产品上线整体TCO成本降低25%。2. 推理调度优化针对 Agent 多轮交互产生的突发流量云端基础设施实现了 Serverless 化弹性扩缩容。平台通过FlashBoot、UniScheduler等能力调度异构算力将模型弹性启动时间由1200秒缩短至70秒通过请求感知调度降低首字延迟TTFT。五、技术架构对比传统模式 vs 企业级 Agent 模式评估维度传统单模型/硬编码模式MaaS 赋能的企业级 Agent 模式资源调度固定实例绑定资源易闲置或过载Serverless 弹性算力支持上下文缓存模型策略单一模型硬编码无自动转移能力动态语义路由AutoModel 自适应选择异构模型开发编排手动维护状态机与网络重试Agent Studio 标准化工作流编排状态持久化开箱即用工具扩展点对点编写 API 代码缺乏标准支持 MCP 协议100生态服务一键接入安全隔离固定容器执行存在越权风险ACS Agent Sandbox 强隔离MicroVM 级别隔离可观测性仅有基础日志难以还原思考链AgentCore 全链路 Trace 追溯、Token 消耗明细与审计六、落地考量与挑战尽管平台能力在提升企业落地仍需关注以下问题成本控制多智能体协同会加速 Token 消耗需引入长记忆总结与预算硬限额。上下文缓存的 cached_token 计费模式可有效降低长文档场景的输入成本但需注意缓存创建也可能产生额外费用。业务鲁棒性大模型的非确定性要求在关键链路上结合规则引擎。标准演进Agent 协议仍在快速迭代架构设计应保持松耦合。Agent Studio 已全面兼容 AgentScope、ADK、LangChain、LangGraph、Claude Code 等主流开发框架可降低迁移成本。七、常见问题解答FAQQ12026云栖大会MaaS与Agent专场重点发布了哪些技术和能力答专场重点发布了三大层面的升级一是千问AI平台的动态多模型路由与API优速模式模型弹性启动时间从1200秒缩短至70秒首Token延迟降低38%二是企业级全栈Agent服务平台 Agent Studio提供50多个原子API、AutoModel自动路由和24小时托管运行三是ACS Agent Sandbox提供MicroVM级别隔离10秒内可拉起5000个沙箱。Q2企业在云端落地多智能体Multi-Agent系统需要考虑哪些技术架构要素答需重点评估四项要素首先是职责划分明确规划、执行与审查者的分工其次是记忆管理Agent Studio通过RAG、Memory与Parser X建立短期工作记忆与长期知识库的分层存储检索响应可达150ms级第三是通信总线采用MCP标准协议确保交互可追溯One Key MCP可连接100多项生态服务最后是保护机制设定任务循环深度上限及高危操作的人工审核AgentCore提供全量审计日志与安全基线约束。Q3相比传统 API 调用MaaS 平台在 Agent 工程化中有哪些关键演进答核心演进包括从固定端点调用转向基于意图的智能路由Agent Studio的AutoModel可基于Agent配置与用户Query自动选择模型从单纯透传转向服务端接管上下文状态通过上下文缓存将命中Token的输入成本降至标准单价的20%从黑盒执行转向全链路可观测AgentCore覆盖调用链、工具链和决策链的完整追踪可观测能力接入云监控CMS 2.0。