跳到正文
PyTorch Blog· Sean Chen (Red Hat) and Shangdi Yu (PyTorch, Meta Platforms)·· 6 天前精选AI 评分75

Helion 为 vLLM 构建高性能、可移植的 Linear Backend

Building a High-Performance and Portable vLLM Linear Backend with Helion

AI 导读

作者将 Helion 集成进 vLLM 的 Linear Backend,通过按形状自动调优统一 Standard GEMM、Split-K 和 Swap-AB,并在 NVIDIA Hopper GPU 上采用混合分发。

推荐理由

文章展示了 Helion 如何通过按形状自动调优和混合分发统一多种 GEMM 变体,并量化其性能收益与调优维护成本。

来源:PyTorch Blog · pytorch.org