PyTorch Blog· Sean Chen (Red Hat) and Shangdi Yu (PyTorch, Meta Platforms)·· 6 天前精选AI 评分75
Helion 为 vLLM 构建高性能、可移植的 Linear Backend
Building a High-Performance and Portable vLLM Linear Backend with Helion
AI 导读
作者将 Helion 集成进 vLLM 的 Linear Backend,通过按形状自动调优统一 Standard GEMM、Split-K 和 Swap-AB,并在 NVIDIA Hopper GPU 上采用混合分发。
推荐理由
文章展示了 Helion 如何通过按形状自动调优和混合分发统一多种 GEMM 变体,并量化其性能收益与调优维护成本。
来源:PyTorch Blog · pytorch.org