Triton-Ascend FlashAttention 优化实战
基于 Triton-Ascend 构建昇腾亲和算子,针对FlashAttention fwd&bwd算子展开优化,通过细粒度 CV 流水编排等优化方式,将 Cube 利用率提升到 90%+。
Topic / 2 items
收录所有带有此标签的公开笔记与项目,并按发布时间排序。
基于 Triton-Ascend 构建昇腾亲和算子,针对FlashAttention fwd&bwd算子展开优化,通过细粒度 CV 流水编排等优化方式,将 Cube 利用率提升到 90%+。
从 MatMul、Online Softmax、Paged Attention 和 Quest Sparse Attention,一直到 vLLM-Ascend 集成与端到端评测。