跳到正文
原文
vLLM 官方博客(RSS)·· AI 评分42

vLLM 支持 NVIDIA Vera Rubin NVL72:吞吐量达 GB200 NVL72 的 7.8 倍

vLLM Support for NVIDIA Vera Rubin NVL72: 7.8x Throughput over GB200 NVL72

AI 导读

vLLM 现已支持 NVIDIA Vera Rubin NVL72,并称早期结果在 AgentX 上、交互性相当时每 GPU 吞吐量达 GB200 NVL72 的 7.8 倍。目前提供每日容器构建,已支持 DeepSeek、Kimi、GLM 和 MiniMax 等模型。vLLM 还称在 MLPerf 中 VLM 吞吐量最高达 GB300 NVL72 的 3.7 倍。

资讯发现:AIHOT 原收录页

来源:vLLM 官方博客(RSS) · vllm.ai