vLLM 官方博客(RSS)·· AI 评分42
vLLM 支持 NVIDIA Vera Rubin NVL72:吞吐量达 GB200 NVL72 的 7.8 倍
vLLM Support for NVIDIA Vera Rubin NVL72: 7.8x Throughput over GB200 NVL72
AI 导读
vLLM 现已支持 NVIDIA Vera Rubin NVL72,并称早期结果在 AgentX 上、交互性相当时每 GPU 吞吐量达 GB200 NVL72 的 7.8 倍。目前提供每日容器构建,已支持 DeepSeek、Kimi、GLM 和 MiniMax 等模型。vLLM 还称在 MLPerf 中 VLM 吞吐量最高达 GB300 NVL72 的 3.7 倍。
资讯发现:AIHOT 原收录页
来源:vLLM 官方博客(RSS) · vllm.ai