快速了解本文
CoreWeave 推出 Vera Rubin NVL72,推理吞吐量较 GB200 提升 4.8 倍。
Vera CPU 支持超 1.1 万个并发沙箱,启动速度提升 3 倍以上。
Forge 平台整合 Serverless RL,训练速度提升 1.4 倍且成本降低 40%。
本摘要由 AI 辅助整理,请以正文内容为准。
2026年9月,CoreWeave 在 CoreWeave Fully Connected 活动上宣布,在 CoreWeave Cloud 上提供配备 Spectrum-X 102.4T 以太网网络的 NVIDIA Vera Rubin NVL72 系统、专为 AI 代理工作负载设计的 Vera CPU,以及整合持续改进环境的 CoreWeave Forge 平台。其目标是解决代理式 AI 在长上下文推理、高并发工具调用和持续迭代中面临的基础设施瓶颈。
01推理吞吐量与沙箱并发的硬件跃升
AI 实验室 Cognition(Devin AI 开发商)成为首个在 Vera Rubin 上运行生产工作负载的客户,在 CoreWeave 上运行训练、强化学习和生产推理。Cognition 的早期基准测试显示,在基于 FrontierCode 任务子集生成的 SWE-2 推理工作负载上,Vera Rubin NVL72 的总 token 吞吐量比 GB200 NVL72 提高 4.8 倍,量化了新一代硬件在代理式代码生成和长上下文推理中的性能提升。
针对代理式 AI 在强化学习和工具调用中对高并发隔离沙箱的算力需求,CoreWeave 宣布提供 NVIDIA Vera CPU。该 CPU 单机架包含 128 个 CPU 和 11,264 个核心,支持超过 11,000 个并发隔离环境,配合 CoreWeave Sandboxes 和 Spectrum-X 以太网交换机使用。测试表明,在 Vera CPU 上,CoreWeave 代理沙箱的启动时间快 3 倍以上,且在 Terminal-Bench 任务中性能提升 1.7 倍。Vera Rubin NVL72 与 Vera CPU 的组合,分别从推理吞吐量和沙箱并发启动两个维度应对了代理式 AI 的算力瓶颈。需要注意的是,上述性能数据基于早期基准测试和特定工作负载,通用场景表现需进一步验证。
02打通生产到训练的反馈闭环
在软件平台层面,CoreWeave 推出 CoreWeave Forge 平台,整合 Weights & Biases、OpenPipe 和 marimo,提供用于持续改进模型和代理的互联环境,支持跨模型、框架和云的开放环境。
Forge 平台的 Serverless RL 功能利用用户自身的生产信号进行无服务器强化学习,使训练速度比自管理设置快 1.4 倍,成本降低 40%,降低了代理式 AI 持续迭代和模型微调的基础设施成本与门槛。同时,NVIDIA Dynamo 开源推理框架为 CoreWeave 的托管推理服务及处于私有预览阶段的 RL Rollouts 提供动力,支持在不重新部署的情况下将新检查点加载到实时部署中。CoreWeave Forge 通过整合 Serverless RL 和 Dynamo 框架,打通了生产环境数据到训练环境的直接反馈链路,使代理式 AI 的持续迭代不再需要重建基础设施。目前 RL Rollouts 仍处于私有预览阶段,全面可用性待确认。
