全球动态2026.09.17

MLPerf v6.1 发布:AMD 512卡集群刷新吞吐纪录,英伟达 Vera Rubin 首秀

MLPerf Inference v6.1 最新测试结果显示,AMD 凭借 512 个 MI355X 集群在 DeepSeek R1 推理总吞吐量上超越英伟达 288 卡 GB300 配置;同时,英伟达下一代 Vera Rubin 架构首次现身,其 72 GPU 配置性能较 GB300 提升 95%。

朋克君
发布者朋克君
预计阅读 2 分钟
我要投稿
AI 摘要
约 1 分钟

快速了解本文

01

AMD 512卡集群在DeepSeek R1测试中刷新吞吐量纪录。

02

英伟达Vera Rubin芯片首秀,性能较GB300提升95%。

03

MLPerf v6.1基准测试结果于2026年9月正式发布。

本摘要由 AI 辅助整理,请以正文内容为准。

MLCommons 于 2026 年 9 月正式发布 MLPerf Inference v6.1 基准测试结果。本次测试重点聚焦 AI 推理吞吐量、扩展效率以及不同 GPU 配置下的性能表现。在备受关注的 DeepSeek R1 推理测试中,AMD 与英伟达分别展示了大规模集群扩展与下一代架构迭代的最新成果。

01AMD 512 卡集群刷新吞吐纪录

在 DeepSeek R1 测试项目中,AMD 提交了迄今为止规模最大的 MLPerf 提交,使用 512 个 Instinct MI355X GPU 组成集群。测试数据显示,该配置取得了 2,901,950 tokens/s 的离线成绩和 2,405,310 tokens/s 的服务器成绩。

作为对比,英伟达在同一测试项目中提交了 288 GPU 配置的 GB300 和 GB200。其中,GB300 的离线成绩为 2,705,130 tokens/s,服务器成绩为 2,028,030 tokens/s。AMD 凭借 512 个 MI355X 的大规模集群配置,在总吞吐量上超越了英伟达 288 个 GB300 的配置。这展示了 AMD 在超大规模推理集群上的扩展能力与 ROCm 软件栈的成熟度,使其在通过扩大集群规模换取吞吐量的策略上取得阶段性领先。不过,由于双方提交的 GPU 数量存在差异,直接对比总吞吐量存在规模差异,实际评估仍需结合单卡效率综合考量。

02英伟达 Vera Rubin 首秀展现跨代优势

除了当前主力产品的交锋,英伟达下一代 AI 超级芯片 Vera Rubin (VR200) 首次进入 MLPerf 推理基准测试。该平台由 Rubin GPU 和 Vera CPU 组成,其中 Rubin GPU 拥有 288GB HBM4 内存,FP4 峰值推理能力可达 50 PFLOPS,Vera CPU 则配备 88 个定制 Arm 核心。此次测试提交了 36 GPU 和 72 GPU 两种配置。

基于测试数据,在相同的 72 GPU 配置下,Vera Rubin 的推理性能比当前的 GB300 快 95%;其 36 GPU 配置版本的性能也超过了 72 GPU 配置的 GB200。Vera Rubin 在首次现身 MLPerf 测试中即展现出显著的跨代性能优势,直观量化了该架构相较于 Blackwell Ultra 的性能飞跃。这表明英伟达正通过 HBM4 内存和 FP4 优化等极致架构迭代,拉开与竞争对手的代际差距。目前 Vera Rubin 处于基准测试首秀阶段。

ARTICLE RECORD

转载说明

转载请注明文章出处。

TOPICS · 05

文章标签