AIHOT公开聚合:原始报道发现·· 10 小时前AI 评分41
Baseten 智能体推理优化:引擎提速 50-90%
Agentic inference optimization: 50-90% faster engines
AI 导读
Baseten称,其LLM生成的推理引擎在Qwen-3.6-35B-A3B上单流解码最高比vLLM 0.25.1快90%。该测试以NVFP4精度运行于单块B200,TTFT快2.33倍,使该模型此前并不实用的超低延迟场景成为可能。方法受MetaInfer启发,无需模型后训练即可从零构建专用推理引擎。
来源:AIHOT公开聚合:原始报道发现 · baseten.co