Back to Sglang

FlashAttention-4 (CuTeDSL)

python/sglang/kernels/ops/attention/flash_attn/cute/README.md

0.5.17687 B
Original Source

FlashAttention-4 (CuTeDSL)

FlashAttention-4 is a CuTeDSL-based implementation of FlashAttention for Hopper and Blackwell GPUs.

Installation

sh
pip install flash-attn-4

If you're on CUDA 13, install with the cu13 extra for best performance:

sh
pip install "flash-attn-4[cu13]"

Usage

python
from flash_attn.cute import flash_attn_func, flash_attn_varlen_func

out = flash_attn_func(q, k, v, causal=True)

Development

sh
git clone https://github.com/Dao-AILab/flash-attention.git
cd flash-attention
pip install -e "flash_attn/cute[dev]"       # CUDA 12.x
pip install -e "flash_attn/cute[dev,cu13]"  # CUDA 13.x (e.g. B200)
pytest tests/cute/