跳到正文

全部动态

今日 2 条
今天10月3日周六
  1. AIHOT公开聚合:原始报道发现41

    Baseten 智能体推理优化:引擎提速 50-90%

    Baseten称,其LLM生成的推理引擎在Qwen-3.6-35B-A3B上单流解码最高比vLLM 0.25.1快90%。该测试以NVFP4精度运行于单块B200,TTFT快2.33倍,使该模型此前并不实用的超低延迟场景成为可能。方法受MetaInfer启发,无需模型后训练即可从零构建专用推理引擎。