PyTorch:Blog(RSS)·· 4 天前AI 评分30
用 FBTriton 现代化 Table Batched Embeddings
Modernizing Table Batched Embeddings with FBTriton
AI 导读
PyTorch博客称,FBTriton实现的TBE前向与反向kernel在推荐系统工作负载上优于旧版CUDA kernel。B200上bounds-check组件最高可达1.24x加速。可选地将index转置、排序与游程编码移入前向后,大型B200配置合计延迟由79.537 ms降至66.183 ms(−16.8%)。
资讯发现:AIHOT 原收录页
来源:PyTorch:Blog(RSS) · pytorch.org