跳到正文
PyTorch Blog· Han Xu, Jacky Zhou, Jackie (Jiaqi) Xu, Hongtao Yu, Peng Chen (Dev Infra), Darren Liu, Dev (Devashish) Shankar, Max Leung, Nick Riasanovsky, Hao Yan, Manman Ren, Yuanwei (Kevin) Fang·· 7 天前精选AI 评分74

TLX在NVIDIA Blackwell上优化Jagged Flash Attention并挑战FA4

Optimizing Jagged Flash Attention with TLX: The Road Toward SOTA FA4 on Blackwell

AI 导读

PyTorch团队使用TLX在NVIDIA Blackwell B200上重写Meta Generative Ads Model的Jagged Flash Attention内核,约3.2K行代码在生产Jagged形状上相较FA4的forward快约13%、backward快约50%。

推荐理由

文章以B200上的实测对比拆解TLX优化Jagged Flash Attention的关键方法,展示高层Triton代码如何兼顾性能与迭代效率。

来源:PyTorch Blog · pytorch.org