Triton-Ascend FlashAttention 优化实战
基于 Triton-Ascend 构建昇腾亲和算子,针对FlashAttention fwd&bwd算子展开优化,通过细粒度 CV 流水编排等优化方式,将 Cube 利用率提升到 90%+。
Topic / 1 items
收录所有带有此标签的公开笔记与项目,并按发布时间排序。
基于 Triton-Ascend 构建昇腾亲和算子,针对FlashAttention fwd&bwd算子展开优化,通过细粒度 CV 流水编排等优化方式,将 Cube 利用率提升到 90%+。