NVIDIA Vera存储基准测试:加密、压缩、完整性检查速度更快...
4 小时前 1 阅读来源:developer.nvidia.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
NVIDIA发布Vera存储处理器基准测试:加密、压缩、完整性校验性能全面超越x86
在AI智能体(Agentic AI)工作流中,存储系统正成为决定推理效率的关键瓶颈。随着企业知识检索、持久化内存访问、KV缓存复用、工具调用等操作在数千个并发智能体间高频重复,存储路径上的每一次读写都伴随着加密、压缩、校验和冗余计算。这些数据保护与准备功能虽然保障了AI系统的安全性和韧性,却也消耗了大量CPU资源。NVIDIA最新发布的Vera BlueField-4 STX存储处理器基准测试显示,其内置的Vera CPU在处理这些存储密集型任务时,性能显著优于传统x86架构,为AI原生数据平台提供了新的加速路径。
核心变化:Vera CPU为何能解决存储处理瓶颈?
传统存储方案中,数据在写入时需要压缩、加密、计算校验和与冗余,读取时则需验证、解密、解压或重建数据。这些操作全部位于数据路径上,任何一个环节延迟都会拖慢整体数据流。随着智能体并发数和上下文窗口持续扩大,存储系统必须在不影响应用响应速度和Token生成速率的前提下,以加速计算所需的速率供给数据。如果仅靠增加x86核心数来扩展性能,不仅会推高功耗和散热成本,性能仍受制于最慢步骤。NVIDIA将Vera CPU直接嵌入存储数据路径,正是为了解决这一结构性矛盾。
Vera CPU采用88个NVIDIA自研Olympus核心,完全兼容Armv9.2指令集,支持176路NVIDIA空间多线程。其核心优势在于NVIDIA可扩展一致性结构(SCF)与SOCAMM2 LPDDR5X内存子系统的组合:SCF提供高达3.4TB/s的对分带宽和164MB统一L3缓存,确保多核心访问共享数据时的高带宽可预测性;而SOCAMM2内存子系统则提供最高1.2TB/s的聚合内存带宽,即每核心14GB/s,足以支撑带宽密集型和高度并发的工作负载。这种模块化、可现场更换的内存设计,兼顾了LPDDR5X的能效与数据中心所需的可维护性。
实际影响:对跨境电商和AI基础设施意味着什么?
对于依赖AI推理的跨境电商场景,如智能客服、个性化推荐、多语言翻译等,存储处理效率直接关系到响应速度和运营成本。基准测试表明,Vera在加密解密、数据恢复、完整性校验、压缩解压以及多阶段存储流水线等场景中均优于x86 CPU。这意味着存储平台可以用更少的CPU核心和功耗处理更多数据,同时更高的压缩吞吐还能降低存储容量和带宽需求。对于正在构建AI原生数据平台的卖家和技术团队而言,这一进展意味着存储层不再成为GPU算力发挥的瓶颈,企业级安全服务(如加密、校验)可以更高效地嵌入数据路径,而无需牺牲性能。
从更宏观的视角看,NVIDIA将Vera CPU从GPU供数角色扩展到存储处理,反映了AI基础设施正在从"GPU中心"向"全链路加速"演进。存储不再只是被动保存数据的仓库,而是主动参与数据保护与优化的计算节点。对于关注AI基础设施选型的中国出海企业和AI从业者,这一趋势值得留意:未来存储系统的竞争力,将越来越多地取决于其内置处理器的计算能力,而非单纯的读写速度。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
