AI需求激增,存储技术加速升级
2 小时前 2 阅读来源:blogs.nvidia.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
AI算力狂奔,存储架构成新瓶颈?NVIDIA在FMS大会亮出三大招
AI大模型的胃口越来越大,动辄需要海量数据集和超长上下文窗口,这早已冲破了传统系统内存的物理边界。但面对激增的数据洪流,光靠堆砌存储容量显然不够。业界真正需要的,是从AI工厂中提炼出有价值、有依据的洞察,以及支撑这些洞察的高效、安全的存储架构。在本周举行的未来存储与内存大会(FMS)上,NVIDIA一口气公布了多项存储技术进展,并试图向外界传递一个核心观点:AI的下一轮飞跃,不仅取决于加速计算本身的算力,更取决于为这些算力“喂食”的存储基础设施。
压力正在变得空前巨大。随着AI智能体(AI Agent)开始海量消耗数据,GPU甚至可以直接发起存储请求,瞬间产生成千上万个并发操作。为了响应这些请求,存储系统必须持续进行加密、压缩、校验和重建数据。当数千个智能体同时访问存储时,这些关键的数据服务环节极易成为新的性能瓶颈。NVIDIA技术博客中引用的基准测试显示,作为NVIDIA Vera BlueField-4 STX一部分的Vera CPU,在“压缩+加密”两阶段流水线中,其吞吐量比传统x86 CPU最高提升了3.21倍。这意味着,借助Vera,存储平台能以更少的计算基础设施,更高效地吸收AI数据洪流,实现更高的吞吐量。
核心变化:存储从“被动仓库”变为“主动参与者”
在加速计算的语境下,存储不再是 passively 存放数据的仓库,而是变成了数据路径中的主动一环。这彻底颠覆了旧有的存储经济学——过去,我们纠结于数据该放在内存(应用访问更快)还是硬盘(成本低廉、空间充足)。这个权衡在40年前被首次提出,当时衡量标准是“分钟级”的数据访问延迟。而如今,在NVIDIA及其合作伙伴的AI存储方案配合下,同样的权衡已经缩短到“微秒级”。要弥合AI需求与内存短缺之间的鸿沟,必须依赖整个生态系统的深度协同设计,从内存和存储制造商,到构建于其上的软件栈,缺一不可。
开源cuFile API,打破GPU直连存储壁垒
在FMS大会上,NVIDIA宣布将开源其cuFile应用程序接口(API)及其底层的垂直存储软件栈。这套API的核心价值在于,它允许GPU(而非仅限CPU)直接读写存储设备。cuFile是NVIDIA GPUDirect Storage的开放组件,通过利用数十万个GPU线程、高速高带宽内存等技术,能在微秒级时间内安全地访问存储数据。这代表了行业正在基于Linux最佳实践,统一一个“安全优先”的存储栈,实现GPU与数据之间的互操作性。此外,快速、安全的数据访问也是支撑主动与被动网络安全防御的基础。将cuFile开放,有助于让安全上下文、数据和存储以AI防御所需的速度被访问。这类开放技术也支持了诸如新成立的Open Secure AI Alliance等倡议。该联盟由Google、Intel、NVIDIA和Meta作为初始维护者,向所有贡献者开放API,并针对各种软硬件平台进行优化,旨在为开发者和企业驱动创新与效率。
联合行业巨头,推进AI存储新前沿
除了开源,NVIDIA还在与存储行业领导者共同推进一项名为“Storage-Next”的倡议。这项由NVIDIA主导的计划,汇集了存储制造商、控制器供应商、散热设计、冷却与编排运营商以及标准制定机构,共同定义GPU驱动型存储应有的行为模式,并将这些技术进展转化为可互操作的开放行业标准。目前,Storage-Next已吸引了超过40家领先的存储和闪存供应商参与。这标志着AI存储正从单点技术突破,走向全行业协同制定标准的阶段,对于依赖AI基础设施的跨境电商和AI应用开发者而言,这意味着未来数据处理的效率和安全性将迎来系统性提升。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
