跳到正文
  1. PyTorch Blog71

    PyTorch FBTriton 优化 TBE 前向与反向内核,性能超过遗留 CUDA 实现

    FBTriton 用 Triton 重写 Table Batched Embedding(TBE)的前向与反向内核,在相关推荐系统负载上超过遗留 CUDA 内核。在 GB200 的 307 个 shard 配置中,中位前向加速比为 1.28×。在一个大型 B200 配置中,前向与反向合计延迟从 79.537 ms 降至 66.183 ms,下降 16.8%。

    推荐理由:文章把 FBTriton 与遗留 CUDA TBE 内核放在多种 shard 配置下比较,并拆解负载不均与寄存器占用等优化如何影响性能。

  1. PyTorch Blog75

    Helion 为 vLLM 构建高性能、可移植的 Linear Backend

    作者将 Helion 集成进 vLLM 的 Linear Backend,通过按形状自动调优统一 Standard GEMM、Split-K 和 Swap-AB,并在 NVIDIA Hopper GPU 上采用混合分发。

    推荐理由:文章展示了 Helion 如何通过按形状自动调优和混合分发统一多种 GEMM 变体,并量化其性能收益与调优维护成本。

  1. PyTorch Blog74

    TLX在NVIDIA Blackwell上优化Jagged Flash Attention并挑战FA4

    PyTorch团队使用TLX在NVIDIA Blackwell B200上重写Meta Generative Ads Model的Jagged Flash Attention内核,约3.2K行代码在生产Jagged形状上相较FA4的forward快约13%、backward快约50%。

    推荐理由:文章以B200上的实测对比拆解TLX优化Jagged Flash Attention的关键方法,展示高层Triton代码如何兼顾性能与迭代效率。

已经到底了