PyTorch FBTriton 优化 TBE 前向与反向内核,性能超过遗留 CUDA 实现
FBTriton 用 Triton 重写 Table Batched Embedding(TBE)的前向与反向内核,在相关推荐系统负载上超过遗留 CUDA 内核。在 GB200 的 307 个 shard 配置中,中位前向加速比为 1.28×。在一个大型 B200 配置中,前向与反向合计延迟从 79.537 ms 降至 66.183 ms,下降 16.8%。
推荐理由:文章把 FBTriton 与遗留 CUDA TBE 内核放在多种 shard 配置下比较,并拆解负载不均与寄存器占用等优化如何影响性能。