全球动态2026.08.24

NVIDIA Groq 3 LPX 全面投产,长上下文推理达每秒 3400 token

NVIDIA 机架级推理系统 Groq 3 LPX 已全面投产,在 10 万 token 长上下文下运行 Gemma 4 31B 达每秒 3400 输出 token,Nebius 成为首家采用该平台的 AI 云。

数智朋克
发布者数智朋克
预计阅读 2 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

NVIDIA Groq 3 LPX 推理系统已全面投产并投入商用。

02

长上下文场景下输出速度达每秒 3400 token,领先竞品 4 倍。

03

Nebius、CoreWeave 和 SpaceXAI 等首批客户已宣布采用该平台。

本摘要由 AI 辅助整理,请以正文内容为准。

数智朋克讯 NVIDIA Vera Rubin 机架级推理系统 Groq 3 LPX 已全面投产。在 Artificial Analysis 基准中,该平台运行开源智能体模型 Gemma 4 31B,于 10 万 token 长上下文场景下实现每秒 3400 输出 token,比最接近的替代平台快 4 倍。

Groq 3 LPX 与 Vera Rubin NVL72 协同设计:Rubin GPU 负责大规模上下文处理,LPU 加速低延迟解码工作负载。机架级部署可包含 256 个 LP30 加速器,通过直接芯片间链路连接,形成高密度推理引擎。

首批客户已开始采用该平台:

  • Nebius 成为首家采用 Groq 3 LPX 的 AI 云。
  • CoreWeave 已在生产环境部署 Spectrum-X Multiplane,通过多平面并行交换机连接 Vera Rubin 机架,提供高带宽、扁平且无损的 AI 网络。
  • SpaceXAI 宣布将使用 NVIDIA Vera CPU 驱动其下一代智能体 AI,并计划将 Vera Rubin 架构从地面数据中心扩展到轨道卫星。

在加州帕洛阿尔托举行的 Hot Chips 大会上,NVIDIA 展示了 Spectrum-X Multiplane,使以太网能在不增加额外网络层级的情况下扩展至更大规模,避免延迟、抖动和成本增加,支撑大规模 AI 工厂的互联需求。

ARTICLE RECORD

转载说明

转载请注明文章出处。

TOPICS · 05

文章标签