破解 AI 推理效率困局,详解华为 OceanStor M900 AI记忆存储新基建

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_1.pngoutput_1

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_2.pngoutput_2

编辑:前沿在线 编辑部

最近半年跑了十多家智算中心并做了调研,一个很直观的感受是:大家都在拼命堆算力,GPU、NPU 的规模翻着番涨,但真到了生产环境跑推理,卡脖子的往往不是算力本身。

聊到推理成本,几乎所有团队都绕不开 KV Cache 的问题。长上下文模型和智能体用得越多,这个问题就越突出。

已经算过的上下文数据存不下、调不动,最后算力只能反复做重复计算,钱投进去了,产出没跟上。

最近在华为全联接大会 2026 上,OceanStor M900 AI 记忆存储在主论坛重磅发布。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_3.jpgoutput_3

这款产品之所以在AI基建领域引起讨论,核心不是存储本身的参数升级,而是它刚好踩中了现在全行业都在面对的痛点:KV Cache 越来越大,原有存储体系接不住了。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_4.pngoutput_4

为什么 KV Cache 突然成了问题?

先简单说下 KV Cache 是什么。

大模型推理的时候,每做完一次计算,都会把对应的中间结果存下来,后面再用到这段上下文的时候,就不用重新计算,直接调用就行。

这部分存下来的中间数据,就是 KV Cache。它就是一个提升推理效率的缓存机制,一直都存在,只是过去没人太当回事。

前几年对话式 AI 为主的时候,一轮对话结束,上下文清空,KV Cache 量小,用完就扔,基本都放在显存里,占不了多少空间。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_5.pngoutput_5

但这两年情况变了。一边是 Agentic AI 开始落地,智能体跑任务是多轮连续的,写代码、查资料、调工具,一跑就是几十步,上下文保存的时间变长;另一边是大模型的上下文窗口越做越大,百万词元已经成了主流配置。两个因素加在一起,KV Cache 的数据量直接就涨了上去。

过去它更多只是推理框架里的一个缓存机制,现在实实在在的影响着整个集群的资源分配。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_6.pngoutput_6

现有存储的两头堵困境

问题是,现有的存储体系,从设计之初就不是为这么大量的 KV Cache 准备的。现在行业普遍遇到的是两头堵的情况。

一头是显存不够用。

显存离计算最近,速度最快,但容量小、成本高。KV Cache 全都堆在显存里,占掉大量空间之后,留给模型权重、计算中间态和并发请求的显存就少了,推理的并发量和效率自然受影响。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_7.pngoutput_7

在我们走访的十余家智算中心里,长上下文推理场景下,KV Cache 占用的显存比例普遍偏高。

更麻烦的是,超节点集群里每个节点的显存都是独立的,没法跨节点共享,很容易出现资源错配。有的节点被上下文占满接不了新任务,有的节点还有富余却用不上。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_8.pngoutput_8

最终反映到算力利用率上,我们接触到的千卡级推理集群,实际跑推理的有效算力大多不到五成,其中很大一部分浪费,就来自缓存没命中导致的重复计算。

另一头是传统存储跟不上。

既然显存放不下,放到传统的外部存储行不行?实际跑下来效果并不好。

传统存储本来就是为数据持久化设计的,容量大但延迟高,数据读写要经过 CPU 转发、多层协议转换,通常是毫秒级的延迟。

但 KV Cache 是典型的热数据,要高频反复调用,对延迟的敏感度极高。用传统存储存 KV Cache,数据供给的速度追不上计算的节奏,GPU/NPU 就只能等着,直接表现就是首 Token 时延慢、Token吞吐率上不去,大量算力空转。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_9.pngoutput_9

两个问题加在一起,就形成了现在的尴尬局面:算力越堆越贵,却因为存储的问题,大量算力都浪费掉了。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_10.pngoutput_10

行业的两种解决思路

问题摆在这里,行业也试了不少办法。

早期大多是打补丁的思路,比如扩显存、加缓存层、用软件调度优化,但都只能缓解局部问题,到了超大规模集群的场景,还是解决不了根本问题。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_11.pngoutput_11

过去一年多,全球的头部厂商都在往这个方向布局,慢慢形成了两种不同的技术路径。

第一种还是围绕计算节点做延伸,通过更大的本地缓存、更高速度的节点互联,让每个计算单元能用到更多的 KV Cache。

这种方式对现有架构改动小,部署快,但本质上还是没跳出单个节点的框架,集群大了之后,调度和容量还是会碰到天花板。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_12.pngoutput_12

第二种思路是把 KV Cache 从计算节点里独立出来,专门做一层共享的 AI 记忆数据基础设施。

所有节点的 KV Cache 统一管理,形成一个共享的资源池,整个集群的计算单元都可以调用,不用每个节点各自存一份。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_13.pngoutput_13

不只是华为,英伟达、阿里云等厂商也都在从各自的技术栈出发,探索类似的方向。这条路架构上更彻底,能从根本上解决规模和调度的问题,但对厂商的全栈技术能力要求也更高。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_14.pngoutput_14

华为 AI 记忆存储的落地路径

这次华为发布的 OceanStor M900 AI 记忆存储,走的就是第二条路线,把 AI 记忆存储作为独立的一层来做。根据华为官方发布的技术参数,它主要从三个维度解决问题。

首先是容量。它通过灵衢高速互联网络把显存、内存、AI 记忆存储等资源整合起来,实现全局池化和分级存储,打破节点的物理边界,把承载的介质从显存、内存延伸到 SSD。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_15.pngoutput_15

官方数据显示,单集群可以提供 64PB 的共享记忆容量,对单个 NPU 来说,可调度的 KV Cache 逻辑容量从 GB 级升到了 TB 级。

容量上去了,能放下的上下文就多了,缓存命中率自然会提升,重复计算的情况也就少了。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_16.pngoutput_16

然后是性能。它用了 CPU、网络、盘控三芯合一的架构,支持原生 KV 语义,省去了传统架构里 CPU 转发、多层协议转换的环节,让 NPU 可以直接访问存储里的 KV 数据。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_17.pngoutput_17

根据华为官方给出的数据,这套架构可以把访问时延降到 60μs,相比传统方案缩短 90%;单集群的聚合带宽可以达到 40TB/s,比业界主流方案提升 1.5 倍。

官方给出的测试结果是典型 AI 编程场景下 Token 吞吐率翻倍、首 Token 时延减半。

最后是寿命和成本。KV Cache 是高频读写的数据,对 SSD 的磨损很大,普通SSD 用不了多久,长期运维成本很高。

OceanStor M900 AI 记忆存储提供了 KV-Aware 自适应存储算法,根据数据的访问频率和生命周期,把不同的数据放到不同的介质上,减少无效磨损。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_18.pngoutput_18

官方参数显示它最高支持 24 DWPD,也就是每天可以完成 24 次的全盘数据写入,SSD 的使用寿命比业界标准提升 16 倍,可以稳定运行三年。算下来全生命周期的介质更换量可以大幅减少,运维成本更低。

整体看下来,这是一套完整的商用产品方案,而不是单点的技术验证,也让 AI 记忆存储这个方向,有了可以大规模落地的参考样本。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_19.pngoutput_19

基建重心正在发生变化

在我们看来,OceanStor M900 AI 记忆存储的发布,更值得注意的不是一款产品本身,而是它背后反映的产业变化。

前几年 AI 基建的核心逻辑很简单:堆算力。谁的卡多、谁的峰值性能高,谁的基建就强。但到了现在规模化推理的阶段,大家慢慢发现,只堆算力的边际效益越来越低。数据供给跟不上,再强的算力也跑不起来。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_20.pngoutput_20

行业的共识正在慢慢形成:AI 基建最终看的不是峰值算力,而是能产出多少有效 Token。接下来的竞争,不只是比谁的算力多,更是比谁能让算力更高效地产出。

AI 记忆存储这一层,补上的就是数据供给的短板。它让 AI 基建不再只围绕计算转,而是开始走向算力、网络、存储的协同。

从目前的产业走向来看,这大概率是接下来几年 AI 基建演进的一个核心方向。毕竟到了规模化阶段,效率永远是核心命题。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_21.pngoutput_21

说到底,KV Cache 本来只是推理过程中的一个缓存机制,没人会想到它有一天会成为影响基建架构的核心因素。

但现在的情况是,随着长上下文和 Agent 的普及,它正在逐渐从一个技术细节,变成一类需要独立规划、管理和调度的数据基础设施资源。从全球头部厂商的投入和产品落地的速度来看,这个方向已经越来越清晰了。

/Users/anya/Library/Containers/com.kingsoft.wpsoffice.mac/Data/tmp/picturecompress_20261010100131/output_22.pngoutput_22

AI 基础设施的下半场,核心一定是数据。数据供得上、管得细,才能真正释放算力的潜能。

– END –

Frontiers
Frontiers
文章: 532