华为云CMS记忆存储架构深度解析:从KV Cache池化到NPU直通ASU的工程实现

举报
Snowplow5180 发表于 2026/09/21 20:52:46 2026/09/21
【摘要】 2026年9月,华为云在全联接大会上首次实物展示了CMS记忆存储解决方案。这款产品被定位为Agentic Infra四大支柱之一“增强记忆”的落地载体,通过业界唯一的盘级存储架构,依托灵衢互联总线实现NPU直通AI语义存储模组,为智能体构筑了PB级的记忆空间。这背后要解决的问题非常明确:Agent的长程任务需要持续记住历史交互,但传统架构中,KV Cache被困在单卡显存里,上下文越长,显存...

2026年9月,华为云在全联接大会上首次实物展示了CMS记忆存储解决方案。这款产品被定位为Agentic Infra四大支柱之一“增强记忆”的落地载体,通过业界唯一的盘级存储架构,依托灵衢互联总线实现NPU直通AI语义存储模组,为智能体构筑了PB级的记忆空间。

这背后要解决的问题非常明确:Agent的长程任务需要持续记住历史交互,但传统架构中,KV Cache被困在单卡显存里,上下文越长,显存占用越大,系统被迫频繁丢弃历史记忆,Agent的“记忆”始终是碎片化的。CMS的工程目标,就是让记忆从显存中解放出来,放到一个容量足够大、访问足够快、命中率足够高的专用存储层中。本文从硬件架构、KV Cache分层池化和缓存命中机制三个层面,解析这套记忆基础设施的技术原理。

一、盘级存储架构与NPU直通ASU
CMS最底层的技术差异在于其存储介质的选择。业界现有的KV Cache卸载方案普遍采用DRAM内存池化——将KV Cache从显存卸载到远端服务器的DRAM中,通过高速网络访问。DRAM的优势是延迟低,但代价是单位容量成本高,且单节点DRAM容量有限,PB级扩展几乎不可能在经济上可行。

CMS走了另一条路:盘级存储架构。它以SSD作为主要存储介质,通过AI语义存储模组构建PB级记忆空间。根据官方披露,CMS的记忆模组具备65T的性能,基于华为自研芯片,可以根据负载情况动态调整快速SSD和慢速SSD的比例。这意味着系统在大部分时间用慢速SSD承载海量冷记忆,当某段记忆被频繁访问时,自动提升到快速SSD层。这种动态调整的机制,在容量和性能之间取得了比纯DRAM方案更经济的平衡。

但盘级存储有一个天然短板:延迟远高于DRAM。如果KV Cache的读写需要经过传统存储路径——NPU发出请求、CPU处理、存储协议栈解析、再到达SSD——延迟会高到无法支撑推理场景。

CMS的解法是NPU直通ASU。ASU是AI语义存储模组,它不是一个普通的SSD,而是一个嵌入了语义理解能力的存储单元。NPU通过灵衢互联总线直接与ASU通信,绕过传统的CPU中转和存储协议栈。这种直通架构的关键收益是:KV Cache的读写路径从“NPU→CPU→存储协议→SSD”缩短为“NPU→UB→ASU”,延迟大幅降低。官方数据称CMS实现了TB级的记忆极速读取,性能优于业界同类产品50%。

从工程角度看,NPU直通ASU的设计实际上是将“语义存储”能力下沉到了硬件层。ASU不仅存储原始KV Cache数据,还维护了语义索引,NPU可以通过语义化的方式检索记忆,而不是依赖精确的键值匹配。

二、KV Cache分层池化:从显存到盘级存储的透明迁移
CMS的核心能力是KV Cache分层池化。它建立了一套从L1到L3的分层缓存体系:

L1层(NPU显存) :当前正在处理的推理请求的KV Cache驻留在此,访问延迟最低

L2层(DRAM内存池) :近期使用过但当前不活跃的KV Cache缓存在分布式DRAM内存池中,作为显存和盘级存储之间的缓冲

L3层(盘级存储) :历史对话的KV Cache和公共前缀持久化在盘级存储中,容量可达PB级

当推理请求需要访问历史KV Cache时,系统按照L1→L2→L3的顺序逐层查找。如果L3命中,数据从盘级存储加载到L2,再加载到L1,整个过程对上层推理框架透明。开发者不需要修改推理代码,也不需要手动管理KV Cache的迁移。

这套分层体系的价值在于以存代算。大模型推理中,KV Cache的重复计算是最大的算力浪费来源。一个多轮对话场景中,如果用户在第10轮提问时,系统需要重新计算前9轮的KV Cache,算力消耗是巨大的。有了分层池化后,前9轮的KV Cache从L3或L2直接加载,只有第10轮的增量部分需要计算。官方数据显示,这种以存代算的策略将推理首Token时延降低了90%。

三、95%缓存命中率的实现机制
CMS最关键的工程指标是95%的记忆缓存命中率。这个数字直接决定了系统在多大程度上能够避免冗余计算。

命中率的实现依赖于两个机制。

分布式内存池化与分层联动。CMS通过分布式内存池化技术将分散在各节点的DRAM资源统一管理,形成L2缓存层。当多个推理请求共享相同的System Prompt或公共前缀时,这些公共部分的KV Cache只需要计算一次,结果存入L2内存池,后续所有请求直接命中。官方称CMS可实现95%的记忆缓存命中。

语义感知的预取与置换策略。CMS的ASU模组内置了语义理解能力,它能够识别KV Cache之间的语义关联。例如,当Agent正在处理一个关于“产品退换货政策”的请求时,ASU能够预判后续可能需要访问“订单状态查询”相关的KV Cache,提前将相关记忆从L3预取到L2。这种语义级的预取策略,将传统缓存中“被动等待未命中”的模式转变为“主动预测并提前加载”,大幅提升了有效命中率。

四、对Agent长程任务的实际意义
CMS的架构设计直接回应了Agent场景的两个核心痛点。

天级长程任务的记忆持续性。传统推理架构中,KV Cache随着对话轮次增长而膨胀,系统必须在某个阈值上截断历史记忆。一个需要跨天执行的Agent任务——比如持续跟踪一个订单的全流程——在传统架构下几乎无法保持完整上下文。CMS的PB级记忆空间允许Agent将数天甚至数周的交互历史完整保存,随时回溯,官方称其支持“天级长程任务”。

多Agent协作中的记忆共享。在Agent Team模式下,多个Agent实例并行处理不同子任务,但它们需要共享同一份业务上下文。CMS的分布式内存池化使得KV Cache可以在多个推理节点之间共享,一个Agent产生的记忆可以被同组的其他Agent直接读取,无需重复计算或通过应用层传递。

五、总结
CMS记忆存储解决方案的技术本质,是将KV Cache的管理从“单卡显存问题”升级为“分布式记忆基础设施问题”。盘级存储架构解决了容量问题,NPU直通ASU解决了盘级存储的延迟问题,KV Cache分层池化解决了成本与性能的平衡问题,语义感知的预取与置换策略解决了命中率问题。这四个层次的协同,构成了一个从NPU到盘级存储的完整记忆数据通路。

对于正在构建Agentic AI应用的团队来说,CMS的架构提供了一个重要的设计参照:Agent的记忆不应该是一个被动的缓存,而应该是一个主动的、语义感知的、可持久化的记忆系统。当Agent从单轮问答走向长程任务执行时,记忆基础设施的质量将直接决定Agent能否真正“记住”并“理解”它的历史交互。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0)

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。