英伟达在FMS 2026峰会上宣布,将旗下的GPU存储加速API cuFile全面开源,同时公布SCADA全新存储架构,彻底打破传统CPU主导IO的传输瓶颈,实测场景下GPU存储IOPS最高实现5倍提升。
长期以来,GPU读取数据必须通过CPU进行调度,这种宿主模式在处理AI推理产生的大量512字节微小请求时,会造成严重的微秒级延迟。
虽然之前的GPUDirect Storage(GDS)实现了数据链路的CPU绕过,但指令控制仍需CPU参与,使得系统在小粒度读写任务中提前触发性能瓶颈、IO资源率先耗尽。

此次推出的SCADA技术彻底解决了这一难题,SCADA允许GPU直接发起存储I/O请求,管理NVMe硬盘的队列深度,实测数据显示,在处理数据分析任务时,SCADA的速度是CPU触发模式的5.3倍,而硬件成本最高可降低21.7倍。
在美光展示的参考设计中,使用3颗H100显卡成功驱动了44块PCIe Gen6 SSD,实现了惊人的2.3亿次随机读IOPS。这意味着单台服务器的存储吞吐达到了118GB/s,且负责调度的单颗CPU在整个过程中几乎处于空闲状态。

同时针对AI推理中KV缓存频繁产生的小数据读写,英伟达正式推出Storage-Next产业联盟计划,重点优化512字节扇区的读写表现,以解决传统硬盘在4KB扇区下造成的8倍读取放大问题。
该构想最早在2025年GTC大会提出,目前联盟成员已超40家闪存与存储厂商,包含DDN、铠侠、美光,还有存储控制器企业、散热厂商以及标准化组织,各方将共同制定一套新标准:当GPU取代CPU成为存储访问主体时,固态硬盘应当如何适配运行。
硬件层面上,为承载cuFile开源生态与SCADA全新存储架构的落地,英伟达打造了新一代基于Vera BlueField-4存储处理器的STX架构系统,并计划在2026年下半年正式推出商用整机。

虽然目前英特尔也已加入开源组织并参与代码维护,标志着传统CPU主导IO调度的格局被颠覆,cuFile与SCADA也从英伟达私有技术,升级为全行业通用开源标准,有效改善了跨平台兼容性。
但该技术的规模化普及仍受两大核心条件制约,一是STX+SCADA新架构的跨硬件、跨平台适配优化进度。二是美光、三星等厂商能否针对512字节小包场景完成主控与固件的底层重写。
这两点最终决定了这套新一代AI存储架构的商用普及节奏。
免责声明:本文仅代表作者个人观点,与每日科技网无关。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
本网站有部分内容均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,若因作品内容、知识产权、版权和其他问题,请及时提供相关证明等材料并与我们联系,本网站将在规定时间内给予删除等相关处理.



