热点事件历史事件
PyTorch用FBTriton现代化TBE内核
1 篇报道1 个报道来源4 天前更新
先了解这件事
AI 综述
2026年10月7日,PyTorch博客发布文章《用 FBTriton 现代化 Table Batched Embeddings》。PyTorch博客称,FBTriton实现的TBE前向与反向kernel在推荐系统工作负载上优于旧版CUDA kernel。B200上bounds-check组件最高可达1.24x加速。可选地将index转置、排序与游程编码移入前向后,大型B200配置合计延迟由79.537 ms降至66.183 ms(−16.8%)。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 06:57
PyTorch博客称FBTriton版TBE前后向kernel优于旧CUDA,B200大型配置延迟降16.8%。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- PyTorch:Blog用 FBTriton 现代化 Table Batched Embeddings
PyTorch博客称,FBTriton实现的TBE前向与反向kernel在推荐系统工作负载上优于旧版CUDA kernel。B200上bounds-check组件最高可达1.24x加速。可选地将index转置、排序与游程编码移入前向后,大型B200配置合计延迟由79.537 ms降至66.183 ms(−16.8%)。