AI数据中心的存储玩法,正在被英伟达重新改写。就在美国加州圣克拉拉举行的FMS 2026未来存储与内存大会上,英伟达一口气甩出两记重拳,一是把旗下的GPU存储加速API cuFile彻底开源,二是正式发布全新的SCADA存储架构,让GPU能够直接对固态硬盘发起读写请求,彻底甩掉CPU这个中间商。官方给出的实测数据相当夸张,在典型场景下GPU存储IOPS最高实现了5倍以上的提升,原本被认为铁板一块的CPU主导IO时代,正在裂开一道越来越大的口子。

要明白英伟达为什么非要对存储动手,得先看看现在的AI服务器是怎么运转的。长期以来,GPU想要读取数据,都必须经过CPU来调度,这种模式叫宿主模式,CPU既是老板又是司机,数据从硬盘到显存的每一段路都得由它来指挥。放在AI训练那种动辄几个GB的大批量数据传输里,这套模式问题不大,因为控制开销相对小。可一旦换成AI推理,情况就完全变了,推理过程中会疯狂产生512字节级别的微小请求,键值缓存、向量检索、嵌入向量这些操作每秒能堆出上百万次小读写,CPU每调度一次就要付出微秒级的延迟,成千上万次叠加下来,GPU空有一身算力,却只能干等着数据喂不上来,成了典型的加速器停转。
有人会说,英伟达不是早就有GPUDirect Storage吗,它不是已经能让GPU绕过CPU直接读数据了吗,这里得拆开说。GDS确实是2019年推出、2021年落地的好东西,它解决的是数据链路的问题,让数据可以通过DMA在硬盘和GPU显存之间直接搬,不用再绕道CPU内存,省掉了一次多余的拷贝。但问题在于,虽然数据搬运绕开了CPU,发号施令的活儿还得CPU来干,每一次读取请求的构造、提交和完成处理,仍然要CPU亲自下场。大数据块读写时这点控制开销可以忽略,可面对AI推理那种每秒百万级的小粒度请求,CPU就再次成了那个拖后腿的角色,IO资源率先被耗光,性能瓶颈提前到来。

这次亮相的SCADA技术,正是要把这最后一段控制路径也从CPU手里夺过来。它的核心思路很简单粗暴,允许GPU直接发起存储IO请求,自己去管理NVMe硬盘的队列深度,把原本属于CPU的活儿全部揽到GPU自己身上。英伟达拿出的实测数据是,在处理数据分析任务时,SCADA的速度是CPU触发模式的5.3倍,而如果用图计算这类负载来衡量,硬件成本最高能降低21.7倍。这两个数字放在一起看就很明白了,性能翻上去的同时,成本还能压下来,等于是用更少的硬件干更多的活,对精打细算的云厂商来说,吸引力不言而喻。
光有理论还不够,英伟达这次拉来美光做了一场实打实的演示,把SCADA的潜力具象化到了令人咋舌的程度。在美光展示的参考设计中,整套系统只用了3颗H100显卡,就成功驱动了44块PCIe Gen6固态硬盘,最终实现了惊人的2.3亿次随机读IOPS。换算成大家更熟悉的吞吐量,这意味着单台服务器的存储吞吐达到了118GB每秒,而在整个过程中,负责调度的那一颗CPU几乎处于完全空闲的状态,真正成了甩手掌柜。要知道,这些驱动器使用的是美光9650,正是目前全球速度顶尖的PCIe 6.0 SSD之一,在SCADA的调度下,从1块到44块SSD的扩展呈现出近乎完美的线性增长,说明这套架构的潜力还远没有被挖尽。

除了SCADA架构本身,英伟达还针对AI推理中一个更隐蔽的痛点,正式推出了Storage-Next产业联盟计划。这个痛点的根源在于传统固态硬盘的4KB扇区设计,AI推理中的键值缓存读写经常是512字节的小数据,可硬盘偏偏要以4KB为最小单位来操作,结果就是每次读取实际只用到512字节,却不得不把整整4KB的数据搬出来,造成了8倍的读取放大,白白浪费了宝贵的带宽和寿命。Storage-Next联盟的目标就是联合产业链上下游,共同制定一套新标准,重点优化512字节扇区的读写表现,让固态硬盘从硬件层面就学会怎么伺候好GPU这位新主子。
这个联盟的来头可不小。构想最早在2025年的GTC大会上提出,如今成员已经扩充到超过40家闪存与存储厂商,名单里既有DDN、铠侠、美光这样的存储原厂,也有存储控制器企业、散热厂商,甚至还有标准化组织。大家聚在一起要干的事只有一件,就是当GPU取代CPU成为存储访问主体之后,固态硬盘到底应该如何适配运行。这已经不是英伟达一家自说自话,而是整个存储产业在为即将到来的范式转移提前铺路,毕竟谁也不想在下一代AI基础设施的竞赛里掉队。

硬件层面的配套也没落下。为了承载cuFile开源生态和SCADA全新存储架构的落地,英伟达打造了新一代基于Vera BlueField-4存储处理器的STX架构系统,并计划在2026年下半年正式推出商用整机。BlueField-4这颗DPU本身就是个狠角色,计算性能相比上代提升6倍,还专门针对AI原生存储做了大量加速设计。把它和SCADA搭配在一起,等于是在硬件和软件两个维度同时发力,为GPU接管存储这件事提供了完整的舞台,而不是停留在PPT上的美好愿景。
最耐人寻味的是生态层面的变化。英伟达这次把cuFile连同一整套底层存储软件栈全部开源,代码托管在GitHub上新成立的XIO-SIG组织里,创始维护者名单里除了英伟达自己,还有谷歌、Meta,甚至连英特尔都赫然在列。英特尔不仅加入了这个开源组织,还实打实地参与代码维护,这个信号再明确不过,连CPU阵营的老大哥都默认了GPU主导IO这个趋势,传统CPU在存储调度上的垄断地位算是被彻底颠覆了。cuFile和SCADA也由此从英伟达的私有技术,升级为全行业的通用开源标准,跨平台的兼容性一下子被拉了起来。
当然,饭要一口一口吃,SCADA这套新架构想要大规模普及,眼下还卡在两个硬骨头上。一个是STX加SCADA新架构的跨硬件、跨平台适配优化进度,光有英伟达一家把生态撑起来还不够,得让整个产业链的硬件都能顺畅跑起来才行。另一个是美光、三星这些闪存原厂,能不能针对512字节小包场景完成主控和固件的底层重写,硬盘端的配合跟不上,GPU再能折腾也是白搭。这两点最终决定了新一代AI存储架构的商用普及节奏,急是急不来的。

平心而论,对咱们普通玩家来说,SCADA这类技术眼下还摸不着,它服务的对象是数据中心里那些动辄几十块SSD、几百张显卡的大家伙。但技术下放的规律从来都没变过,今天机房里用来喂饱AI的存储架构,迟早会以某种形式渗透进消费级市场,就像当年NVMe从企业级走入千家万户一样。英伟达这次把GPU推上存储驾驶位,本质上是在宣告一个时代的转折,算力和存储的边界正在消融,未来的AI基础设施里,GPU将不仅仅是计算的主角,更会成为数据调度的中枢。这场变革才刚拉开序幕,后面还有的是好戏看。
vivoiQOO 15T 16+512G青云 2K珠峰屏x电竞芯片Q3 天玑9500 Monster版 学生游戏手机iqoo15t
Apple/苹果 iPhone 17 Pro Max 512GB 星宇橙色 支持移动联通电信5G 双卡双待手机
佳匹【莱茵认证超护眼】iphone17Promax钢化膜适用苹果16Pro/15/14/13手机膜AR防蓝光防爆绿光防偷窥膜 超清护眼抗蓝光2片+神器 iPhone16
¥17.8
¥34.8
KOORUI科睿24.5英寸 260Hz高刷 Fast-IPS 硬件低蓝光HDR400电竞亮度 1ms响应 暗区突围游戏电脑显示器X5
体重秤米家APP体脂秤电子秤称体重秤减肥专用智能精准体重宿舍家用减肥专用智联精准电子秤体重秤 【爆款】米家APP体脂秤 充电 特厚钢化玻璃
索尼(SONY)ZV-E10K微单数码相机ZV-E10相机直播美颜拍摄Vlog照相神器 APS-C半画幅视频zve10侧翻液晶屏 ZV-E10全新单机(黑) 官方标配【无必备配件/推荐购买套餐】
¥4949
¥5099
CUKTECH酷态科10号超级电能充Ultra氮化镓充电器120W多口快充头接入米家APP兼容PPS100W笔记本小米/苹果17
得力(deli)塑封机a3/a4 四档温控照片文件过塑机办公封膜机覆膜机压膜机冷热裱搭配a3及以下塑封膜使用GQ303
¥188
¥188
雷蛇炼狱蝰蛇mini版 标准版USB电脑电竞吃鸡有线游戏LOL鼠标 毒蝰mini 蝰蛇标准版-黑色
¥80
¥99
网友评论