跳到正文

技术方向

AI Compiler · Tile IR 最新动态

Tile IR 及相关 tile-level 中间表示、代码生成和硬件映射。

8 条精选近 30 天 4 条共收录 8 条

更新

AI Compiler · Tile IR的精选

10月7日周三第 1–8 条
  1. PyTorch Blog71

    PyTorch FBTriton 优化 TBE 前向与反向内核,性能超过遗留 CUDA 实现

    FBTriton 用 Triton 重写 Table Batched Embedding(TBE)的前向与反向内核,在相关推荐系统负载上超过遗留 CUDA 内核。在 GB200 的 307 个 shard 配置中,中位前向加速比为 1.28×。在一个大型 B200 配置中,前向与反向合计延迟从 79.537 ms 降至 66.183 ms,下降 16.8%。

    推荐理由:文章把 FBTriton 与遗留 CUDA TBE 内核放在多种 shard 配置下比较,并拆解负载不均与寄存器占用等优化如何影响性能。

10月3日周六
10月2日周五
  1. PyTorch Blog74

    TLX在NVIDIA Blackwell上优化Jagged Flash Attention并挑战FA4

    PyTorch团队使用TLX在NVIDIA Blackwell B200上重写Meta Generative Ads Model的Jagged Flash Attention内核,约3.2K行代码在生产Jagged形状上相较FA4的forward快约13%、backward快约50%。

    推荐理由:文章以B200上的实测对比拆解TLX优化Jagged Flash Attention的关键方法,展示高层Triton代码如何兼顾性能与迭代效率。

9月19日周六
8月6日周四
  1. GitHub · apache/tvm Releases83

    Apache TVM 发布 v0.26.0.rc0

    Apache TVM 发布 v0.26.0.rc0,完整变更记录覆盖 v0.24.0 至该版本候选版。主要更新包括扩展 Relax 的 TFLite、ONNX 和 PyTorch 前端支持,推进 TIRx 基础设施建设,并进行 IR、运行时和 FFI 重构。

    推荐理由:这份候选发布说明集中呈现了 TVM 在 Relax 前端、TIRx 与运行时的变化,可从中了解本轮开发的主要覆盖面。

6月20日周六
  1. GitHub · apache/tvm Releases71

    Apache TVM v0.25.0 发布

    Apache TVM 发布 v0.25.0,新增 ONNX RMSNormalization converter,并扩展 TFLite、StableHLO 和 PyTorch 前端支持。该版本推进 TIRx 基础设施建设,更新 CUDA、LLVM、Runtime 和 Web 相关组件,同时改进 PyPI wheel 发布与测试流程。

    推荐理由:版本同时覆盖 Relax 前端、TIRx 基础设施与运行时重构,可用于了解 TVM v0.25.0 在模型导入、代码生成和构建发布链路上的变化。

5月9日周六
  1. GitHub · apache/tvm Releases69

    Apache TVM 发布 v0.24.0

    Apache TVM 发布 v0.24.0,包含 Relax、S-TIR、运行时和多个模型前端的更新。版本记录列出多项算子支持与修复、LLVM 最低版本提升至 15,以及将 libtvm.so 拆分为 libtvm_runtime.so 和 libtvm_compiler.so。

    推荐理由:版本记录涵盖 Relax 前端算子支持、S-TIR 迁移和运行时重构,可帮助读者把握 TVM 此次更新涉及的主要工程变化。

10月25日周六
  1. GitHub · apache/tvm Releases82

    Apache TVM 发布 v0.22.0

    Apache TVM 发布 v0.22.0,版本更新涵盖 Relax、FFI、TVMScript 及多个前端和后端的改进。FFI 部分包含独立拆分 tvm-ffi 仓库、接口与 ABI 调整;Relax 增加对 PyTorch ExportedProgram 中 GRU、LSTM 和 MatrixMultiply 算子的支持。

    推荐理由:版本记录集中呈现 FFI 重构与 Relax 前端进展,并涵盖 PyTorch 导入支持及多项后端修复,便于了解 TVM 的主要工程变化。