跳到正文
热点事件历史事件

PyTorch用FBTriton现代化TBE内核

1 篇报道1 个报道来源4 天前更新

先了解这件事

AI 综述

2026年10月7日,PyTorch博客发布文章《用 FBTriton 现代化 Table Batched Embeddings》。PyTorch博客称,FBTriton实现的TBE前向与反向kernel在推荐系统工作负载上优于旧版CUDA kernel。B200上bounds-check组件最高可达1.24x加速。可选地将index转置、排序与游程编码移入前向后,大型B200配置合计延迟由79.537 ms降至66.183 ms(−16.8%)。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. PyTorch:Blog
    用 FBTriton 现代化 Table Batched Embeddings

    PyTorch博客称,FBTriton实现的TBE前向与反向kernel在推荐系统工作负载上优于旧版CUDA kernel。B200上bounds-check组件最高可达1.24x加速。可选地将index转置、排序与游程编码移入前向后,大型B200配置合计延迟由79.537 ms降至66.183 ms(−16.8%)。