Nebius代币工厂率先采用NVIDIA Groq 3 LPX,成首家AI云
7 小时前 1 阅读来源:nebius.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
Nebius 宣布其 Token Factory 平台成为首个采用 NVIDIA Groq 3 LPX 的 AI 云服务,这一举措将大幅提升推理过程中的 token 生成速度。Nebius 表示,NVIDIA Groq 3 LPX 专为极速 token 生成而设计,将应用于其 NVIDIA Vera Rubin NVL72 集群中,为开发者提供更高效的推理性能,尤其是在对速度和响应性要求极高的 agentic(智能体)应用场景中。
推理过程实际上包含两个截然不同的任务:上下文处理(context)和生成(generation)。上下文处理涉及读取长提示词、大型代码库以及多轮智能体对话的持久状态;而生成则是产出用户或智能体实际看到并据此行动的内容。一个智能体完成单个任务可能需要数十次连续的模型调用,每一步都依赖前一步的结果,因此延迟会在整个工作流程中不断累积。正因如此,生成速度越来越成为决定智能体完成有用工作快慢的关键因素。NVIDIA Groq 3 LPX 正是针对长上下文、低延迟场景而设计的,每个 LPX 机架配备 256 个 LPU 加速器、128 GB 片上 SRAM 和 640 TB/s 的扩展带宽,并采用 NVIDIA MGX 机架架构实现全液冷散热。
在性能测试中,Artificial Analysis 对 NVIDIA Groq 3 LPX 运行 Gemma 4 31B 模型进行了基准测试,单用户输出速度达到每秒 3,400 个 token,创下该模型有史以来最快的推理性能纪录。NVIDIA 预计,对于 2T 参数规模的模型,在长上下文和低延迟场景下,Vera Rubin NVL72 每兆瓦的推理吞吐量将比 GB200 NVL72 高出 35 倍,这充分展示了极致软硬件协同设计在智能体规模 token 量下的潜力。
对开发者而言,最值得关注的是,获得更快的生成速度并不需要重新架构现有系统。Token Factory 目前已在主流开源模型上提供生产级推理服务,包括无服务器和专用端点、自动扩缩容、可观测性、函数调用、结构化输出以及大规模运行模型所需的基础设施。Nebius 的做法是让 NVIDIA Vera Rubin NVL72 和 Groq 3 LPX 直接运行在开发者已经在规模化使用的同一 Token Factory 平台上,初期支持部分模型,并保留自动扩缩容和可观测性等熟悉的功能。这意味着开发者无需更换 SDK、无需建立新的供应商关系、也无需重新设置计费方式,只需在模型选择上做出调整,就能让延迟敏感型工作负载获得更快的 token 生成速度。
对于正在构建多智能体管道、实时编程助手和延迟敏感型推理应用的开发者来说,Token Factory 已经内置了多智能体系统所依赖的关键组件:原生函数调用、结构化 JSON 输出、内置的工具调用安全护栏,以及亚秒级延迟目标的专用端点。现在,通过在同一平台上集成 NVIDIA Groq 3 LPX,开发者可以像调用其他 Token Factory 端点一样,以相同的方式和操作模式获得更快的生成速度,而无需承担迁移成本。Nebius 强调,对于已经在 Token Factory 上运行生产流量的团队来说,这只是一次模型选择的变化,而非一次迁移。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
