从Token到沙箱:华为云Agentic Infra如何重构AI基础设施

举报
Snowplow5180 发表于 2026/09/20 18:06:07 2026/09/20
【摘要】 2026年9月,华为云在华为全联接大会上正式发布了灵衢昇腾950智算集群服务,并围绕“高效Token、增强记忆、通智一体化调度、安全自治”四大支柱定义了Agentic Infra新范式。这一提法背后是一个根本性的判断:智能体时代,基础设施的核心不再只是提供算力,而是要让每一个Token更高效,让通算与智算协同起来,让智能体安全、可靠地运行在真实生产环境中。这个判断从何而来?Gartner预测...

2026年9月,华为云在华为全联接大会上正式发布了灵衢昇腾950智算集群服务,并围绕“高效Token、增强记忆、通智一体化调度、安全自治”四大支柱定义了Agentic Infra新范式。这一提法背后是一个根本性的判断:智能体时代,基础设施的核心不再只是提供算力,而是要让每一个Token更高效,让通算与智算协同起来,让智能体安全、可靠地运行在真实生产环境中。

这个判断从何而来?Gartner预测,到2026年底全球40%的企业应用将内置任务型AI智能体;国家数据局监测数据显示,2026年6月我国日均Token调用量激增至近175万亿。当Token消耗量达到这个量级,传统以服务器为单位的资源分配模式已经无法匹配——它既无法让GPU算力在训练和推理之间动态流转,也无法为海量短生命周期的Agent任务提供毫秒级的隔离执行环境。

华为云给出的架构答案包含四个层面:AICS灵衢智算集群提供算力底座,CMS记忆存储解决Agent的上下文持久化,CCE VolcanoNext通智一体化调度引擎负责资源编排,AgentSphere安全沙箱运行时提供毫秒级隔离环境。本文聚焦后两层——调度与运行时,深入解析VolcanoNext和AgentSphere的架构设计。

一、通智一体化调度:训练与推理的资源池化
传统AI基础设施面临一个结构性矛盾:训练作业需要长时间独占大量GPU/NPU资源以保持性能稳定,推理服务则需要高并发、低延迟的弹性资源供给。两种负载的资源需求特征截然不同,传统方案只能将它们隔离在独立资源池中——训练集群按峰值预留,推理集群按均值配置,两者之间没有任何弹性。

VolcanoNext的核心思路是“训推共池+碎片整合”。它不再将训练和推理视为需要隔离的两类负载,而是将GPU/NPU资源池化后统一调度,通过细粒度的资源切分实现同一集群内的混合部署。实测数据显示,这种调度方式可将资源利用率提升30%以上。

这一能力的底层支撑是昇腾NPU的算子级虚拟化。传统NPU分配以“卡”为单位——一个推理任务独占一整张NPU卡,即使只使用了其中一小部分算力,剩余部分也无法分配给其他任务。华为云的FlexNPU技术将一张NPU卡的计算能力在时间维度和空间维度上同时切分,使多个推理任务可以共享同一张卡的计算单元。据官方披露,FlexNPU将AI推理池利用率从平均不足30%提升至70%以上。

在推理场景中,VolcanoNext与Kthena深度集成。Kthena是Volcano的子项目,专为Kubernetes环境下的LLM推理设计,采用ModelServing → ServingGroup → Role的三层架构。ModelServing作为控制平面管理全局副本和版本,ServingGroup将一次端到端推理所需的所有角色组织为独立功能单元,Role则是最小的执行单位。

三层架构的核心价值在于支持Prefill-Decode分离部署。Prefill阶段是计算密集型,需要高算力;Decode阶段是访存密集型,需要大显存和带宽。Kthena将两者解耦部署到不同的Role中,各自独立扩缩容。在Role层级内部,Kthena采用双Pod模板设计——Entry Pod作为流量入口和任务协调者,Worker Pod执行实际的张量计算。控制器自动向Entry和Worker Pod注入关键环境变量,包括GROUP_SIZE(当前Role实例的Pod总数)、ENTRY_ADDRESS(Entry Pod的内部地址)和WORKER_INDEX(每个Worker Pod的唯一索引),使Pod之间的协作逻辑可以基于确定性标识进行。

调度层面,Kthena深度集成Volcano调度器的Gang Scheduling机制,实现“All or Nothing”的原子调度。系统通过minMember计算每个ModelServing实例所需的最小Pod数,默认模式下基于所有Role的副本数统一计算,精细化模式下则支持为每个Role独立设定最小就绪Pod数量。这一机制避免了分布式推理组中因部分Pod无法就绪而导致的调度死锁——当集群资源不足以满足所有Role的最小运行数量时,整个ModelServing实例不会被部分启动。

二、AgentSphere安全沙箱:毫秒级隔离的工程实现
调度层解决了“资源在哪里、怎么分配”的问题,但Agent任务的执行还需要一层安全边界。一个Agent可能需要执行用户提交的Python代码、调用外部API、访问企业内网数据库。如果缺乏隔离机制,轻则资源争抢,重则数据泄露。

传统容器方案在这个场景下暴露了两个短板:启动速度太慢(秒级),无法满足Agent任务毫秒级响应的要求;隔离强度不够(共享内核),无法安全承载不可信的动态代码执行。

AgentSphere的核心机制是预热池。系统预先启动一批隔离容器并保持在待命状态,当Agent任务到达时,直接从预热池中分配实例,100毫秒级完成拉起。这一机制使AgentSphere实现了每分钟十万级的批量创建能力,足以支撑Agent Serving的高频调用和Agentic RL的大规模并行训练。

隔离覆盖三个层面:进程隔离确保每个实例的进程树完全独立;文件系统隔离确保文件读写不跨实例泄漏,持久化需求通过显式挂载对象存储或文件存储实现;网络隔离将入站和出站流量路径分离,Agent无法通过出站连接反向暴露入站端口。

值得注意的是,AgentSphere的隔离强度在“容器”和“虚拟机”之间取得了工程上的平衡。它不追求虚拟机级别的完全硬件隔离,而是通过轻量级虚拟化技术实现接近虚拟机的安全边界,同时保持容器的启动速度。对于一个需要在秒级窗口内拉起成百上千个隔离实例的场景,这个平衡点是合理的——过度追求隔离强度会牺牲弹性能力,而Agent任务的核心诉求恰恰是弹性。

三、从调度到运行时的完整链路
将上述能力串联,一条Agent任务的完整执行链路是:Agent应用通过Kthena的ModelRoute将推理请求路由到合适的推理实例,VolcanoNext将Pod调度到NPU资源充足的节点上,Kthena的PD分离架构将Prefill和Decode分配到不同的Role中执行,KV Cache通过EMS内存池在节点间高效流转。如果Agent需要执行代码或调用工具,AgentSphere的沙箱实例在毫秒级内完成拉起,任务完成后实例归还预热池。

这套架构的每一层都在回答同一个问题:如何让Agent的Token生成更高效、执行更安全。VolcanoNext解决的是“算力在哪里”,Kthena解决的是“推理怎么编排”,EMS解决的是“KV Cache放哪里”,AgentSphere解决的是“代码在哪执行”。四者缺一不可,共同构成了Agentic Infra的完整技术栈。

华为云CEO周跃峰在演讲中做了一个类比:评价一个人聪明与否,反应要快,记忆力也要好,智能体同样如此。这个类比揭示了Agentic Infra的设计逻辑——它不是在传统云基础设施上叠加AI能力,而是从Token效率、记忆持久性、调度协同性和运行时安全性四个维度重新定义了基础设施的每一层。

对于正在规划Agentic AI平台的团队而言,理解这套架构的意义在于:Agent的运行时隔离和通智一体化调度不是可选功能,而是Agent从演示场景走向核心业务的前提条件。当Agent的日均调用量达到万级以上时,调度效率和沙箱启动延迟将成为决定业务可行性的关键指标。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0)

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。