AgentArts Memory 企业级分层记忆:让 Agent 记得住、找得准

举报
AGENT魔方 发表于 2026/08/20 10:36:28 2026/08/20
【摘要】 大模型的上下文窗口从 4K 涨到 128K、甚至 1M,但问题没变——窗口再大,也装不下跨会话的长期交互。关掉对话,上下文就清空了;Agent 要真正“懂用户”,必须有独立的记忆系统。华为云 AgentArts Memory 正是为解决这个问题而生的。AgentArts Memory 在 2026 年 4 月开启公测,此后持续支撑着智能座舱、办公IM等场景的智能化体验,经历了真实业务的打磨。

1.png


Agent 为什么会 “失忆”:上下文窗口装不下长期交互

聊一个常见的问题:AI Agent 什么都好,就是 “记不住

你用过某个 AI 助手处理工作吗?聊了半小时,把项目背景、技术选型、deadline 全交代了。Agent 表现得相当靠谱,帮你梳理了方案、检查了代码。

然后你关掉窗口,去开了个会。回来重新打开对话——

Agent 把你忘了。

你得从头再说一遍:“我们项目用的是 Java,微服务架构,deadline 是月底……”

这种体验,用一个词形容:割裂

2.png

别让 Agent 每次都“重新认识你”——这正是 Memory 要解决的问题。

问题出在哪?大模型的上下文窗口从 4K 涨到 128K、甚至 1M,但问题没变——窗口再大,也装不下跨会话的长期交互。关掉对话,上下文就清空了;Agent 要真正“懂用户”,必须有独立的记忆系统。

华为云 AgentArts Memory 正是为解决这个问题而生的。

AgentArts Memory 在 2026 年 4 月开启公测,此后持续支撑着智能座舱、办公IM等场景的智能化体验,经历了真实业务的打磨。

作为 AgentArts 智能体平台的核心能力之一,Memory 服务提供了一套开箱即用的 Agent 记忆解决方案——短期+长期分层记忆架构、内置语义/偏好/摘要/情景等多类记忆策略、按空间/会话/用户的多层隔离、平台级万级并发支撑、云上全托管、免运维。你不需要自己部署向量数据库,不需要写检索逻辑,不需要处理并发、重试和索引维护。同时当前AgentArts Memory的实际效果已经在权威测评集达到业内领先水平,可以为用户带来更好的体验。

3.png

图1. AgentArts Memory 在LoCoMo的测评集的表现


一、两层记忆架构:会话消息 + 向量沉淀,异步提取衔接

先说一个直觉类比。

你的电脑有内存硬盘:内存速度快、容量小、关机就丢;硬盘速度慢、容量大、持久存储。两者配合,你才能既快速操作,又不丢数据。

AgentArts Memory 的分层思路与它异曲同工——短期记忆是“内存”,长期记忆是“硬盘”:

4.png

整体流程分三步:

  • 用户与 Agent 的对话消息写入短期记忆层(按空间/会话/用户标识归属);
  • 当满足触发条件时(空闲时间到达、累计 Token 超阈值、累计消息数达上限),系统异步提取关键信息,经策略化处理后写入长期记忆层;
  • 应用在调用 LLM 前,可根据当前查询从长期记忆检索相关信息,注入到 LLM 上下文

讲到这里,你可能会问:短期记忆层和 LLM 自己的上下文窗口,是一回事吗?

还真不是。短期记忆层保存的是会话消息本身(带可配置的保留周期);“LLM 每一轮实际看到多少历史”,由应用侧的上下文组装策略决定——放多少条近期消息、是否注入摘要、是否检索长期记忆,都是应用编排的职责。两者是配合关系:AgentArts Memory 把“存”的环节标准化、托管化,把“怎么组上下文”的选择权留给应用。

顺着这个思路还有一问:既然 LLM 的窗口一直在变大,为什么不直接让它记住全部历史? 这笔账要算两笔。一笔是成本:每多一轮历史,推理时消耗的 Token 就多一截,账单一截截变厚;另一笔是效果:上下文越长,模型的注意力越容易被稀释,关键信息“淹没”在大量历史里,反而更可能被忽略——业界常说的“迷失在中间”(Lost in the Middle)就是这个问题。真正有价值的,往往只是对话里的一小部分。

分层记忆的实质,就是只把有价值的信息送进 LLM 的视野——既省成本,也保住效果。理解了这一点,也就理解了为什么这种分层更适合交给一个独立的托管服务来做:

为什么选择 AgentArts Memory而不是自建?

自己搞一套向量数据库 + 检索引擎 + 记忆管理逻辑,光是部署和调优就要耗掉一个小团队的人力。而 AgentArts Memory 提供:

  • 开箱即用的记忆管理:六类策略内置,配置即用,不用从零写提取逻辑
  • 全托管运维:弹性伸缩、自动索引、记忆生命周期管理自动化
  • 数据安全:加密存储(KMS,AES-256 可选),多层隔离,支持公网/私网访问
  • 低延迟检索:为对话体验优化的检索链路

把记忆的复杂度交给平台,把精力留给业务逻辑。


二、短期记忆:消息即存即取,保留期 1 小时~365 天可配

短期记忆的核心职责是承载当前会话的消息流,并在此基础上支持两类衔接:一方面作为长期记忆提取的“原料”,另一方面提供近期消息的快速访问。

保留期:可配置

短期记忆的保留支持设置为1 小时~365 天(示例创建接口 message_ttl_hours 默认 168 小时即 7 天),按业务需要决定消息存多久。

保留期再长也有尽头。当消息过期后,旧消息会被清理——而值得长期保留的信息,已经由提取流程"抢救"进了长期记忆层。

触发条件:什么时候“存盘”?

触发条件可以理解为“自动保存”——不需要手动操作,系统会在合适时机把短期记忆中的关键信息提取到长期记忆。

AgentArts Memory 提供三种触发条件,可组合使用

触发条件 说明 示例配置 直觉类比
空闲时间
会话空闲超过指定时间后触发提取
10 秒
"你去喝咖啡了,系统趁机整理笔记"
最大累计 Token
累计消息 Token 数超过阈值时触发
4096
"笔记本写满了,先归档再继续"
最大累计消息数
累计消息条数达到上限时触发
10 条
"聊够 10 句了,系统做个阶段性总结"

提取设计细节

提取过程是异步的,不阻塞对话写入路径。配合触发条件,记忆在“后台”完成沉淀,用户对提取本身的延迟无感知(但请注意:异步意味着从消息写入到可检索存在生成延迟,生产上应以轮询/重试而非固定等待来使用)。

在工程实现上,这还意味着平台需要处理并发写入、数据一致性和失败重试——这些复杂度都被 AgentArts Memory 封装在底层了,你只需要配置触发条件。

5.png



三、长期记忆:向量化存储 + 多路混合检索

长期记忆层是整个系统的“记忆仓库”。提取出的记忆会经过向量化处理,存储在向量数据库中,供后续检索使用。

存储:每条记忆的三步处理

  • 向量化:通过 Embedding 模型将文本转换为向量,支持语义检索。即使问法与存储时的措辞不同,也能匹配——“用户喜欢喝美式”和“用户的咖啡偏好是什么”能对上。
  • 结构化标注:记忆关联类型(语义/偏好/摘要/情景/事件等)、来源会话、时间戳、用户标识等元数据,供检索时多维过滤。
  • 索引化:建立向量索引和元数据索引,支持多维过滤检索。

检索:不是简单搜索,而是“混合策略”

这是最关键的部分。如果只做向量相似度搜索,会出现一个问题:语义相近但已经过时的记忆会干扰结果

比如用户三个月前说“我用 Java”,上个月改口“最近在转 Go 了”。如果只看语义相似度,两条记忆都可能被检索出来,Agent 不知道该信哪个。

AgentArts Memory 的检索方案是混合检索策略,三管齐下:

  • 语义检索:基于向量相似度,找到语义相关的记忆——解决“找得准”的问题
  • 元数据过滤:按用户 ID、会话 ID、记忆类型等维度过滤——解决“不串号”的问题
  • 时间衰减:近期记忆权重更高,避免过时信息干扰——解决“信哪个”的问题

这套组合拳的效果是:记忆召回准确率达到业内领先水平

6.png



四、多维度隔离:空间 / 用户/ 会话 / 三层,防“记忆串号”

如果你做的是个人用户本地产品,这个问题可能不存在。但如果你做的 Agent 同时服务大量用户——比如智能客服——记忆隔离就是红线

想象一个场景:用户 A 问“我的订单到哪了”,Agent 却“记起”了用户 B 的订单信息。这不是 bug,这是事故

AgentArts Memory 提供三个维度的隔离/过滤机制,层层递进:

隔离维度 说明 典型场景 直觉类比
空间级(Space)
最高层隔离,不同业务/项目使用不同记忆空间
客服系统与办公系统各自独立
不同公司用不同办公楼层
会话级(Session)
同一空间内,不同会话的记忆按会话归属
用户的多轮独立咨询
同一公司里不同会议室
用户级(User/Actor)
记忆条目标注用户归属,检索可按用户过滤
多用户共享同一 Agent 实例
同一会议室里不同人的笔记本

7.png


五、云上全托管:弹性伸缩、自动索引、加密存储

对于开发团队来说,“记忆系统好是好,但运维成本太高”是常见的顾虑。

AgentArts Memory 的答案是:全托管,免运维

  • 弹性伸缩:平台级能力支撑万级并发会话,无需人工预规划容量;存储容量按需使用,无需提前预置。
  • 自动管理:向量索引维护、存储扩容、记忆生命周期全流程自动化管理。
  • 安全合规:数据加密存储,支持 KMS 自定义密钥与 AES‑256 加密算法;兼容公网、私网多种访问模式。
  • 认证鉴权:管理类操作采用 AK/SK 鉴权,业务数据类操作通过 Space 维度 API Key 完成权限校验

8.png


小结

回到开头那个场景——Agent“失忆”的问题,AgentArts Memory 的解法不是让大模型“记住更多”,而是给 Agent 配一个独立的、全托管的记忆系统

短期记忆保证消息可达,长期记忆保证信息可回溯,多维度隔离保证不串号,全托管保证易用。四者结合,构成了 Agent 记忆服务的完整拼图。

9.png

这是一套已经在智能座舱、办公IM等场景真实场景中运行的生产服务。

如果你正在设计一个 Agent 产品,记住一句话:给 Agent 配一个独立的记忆系统,是它从"能用"走向"好用"的关键一步。

现在就试试

AgentArts Memory 已在华为云上线,开通即用。

  • 登录华为云控制台 → 搜索“AgentArts” → 组件库 → 记忆库→ 创建记忆库
  • 3 步完成接入,10 分钟拥有 Agent 记忆能力
  • 详细操作可参考华为云官方文档中的记忆库接入指南

相关链接


容器模仿.png

关注魔方公众号,获取更多前沿资讯

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。