turbo-attn
Optimized CUDAgraph-enabled kernels and attention backend for vLLM, SGLang and more based on TurboQuant near-lossless KV cache compression. SOTA performance with Gemma 4, Qwen 3.6 and other modern LLMs.
Activity
- Latest release
- 22h ago
- Total releases
- 84
- Cadence
- ~daily
- Last 12 months
- 84
Details
- License
- MPL-2.0
- First release
- Apr 30, 2026
Releases
| Version | Released | |
|---|---|---|
0.31.1
patch
| ||
0.31.0
minor
| ||
0.30.2
patch
| ||
0.30.1
patch
| ||
0.30.0
minor
| ||
0.29.0
minor
| ||
0.28.4
patch
| ||
0.28.3
patch
| ||
0.28.2
patch
| ||
0.28.1
patch
| ||
0.28.0
minor
| ||
0.27.0
minor
| ||
0.26.0
minor
| ||
0.25.0
minor
| ||
0.24.4
patch
| ||
0.24.3
patch
| ||
0.24.0
minor
| ||
0.23.0
minor
| ||
0.22.0
minor
| ||
0.21.0
minor
| ||
0.20.3
patch
| ||
0.20.2
patch
| ||
0.20.1
patch
| ||
0.20.0
minor
| ||
0.19.1
patch
| ||
0.19.0
minor
| ||
0.18.1
patch
| ||
0.18.0
minor
| ||
0.17.1
patch
| ||
0.17.0
minor
| ||
0.16.7
patch
| ||
0.16.6
patch
| ||
0.16.4
patch
| ||
0.16.3
patch
| ||
0.16.2
patch
| ||
0.16.1
patch
| ||
0.16.0
minor
| ||
0.15.1
patch
| ||
0.15.0
minor
| ||
0.14.3
patch
| ||
0.14.2
patch
| ||
0.14.1
patch
| ||
0.14.0
minor
| ||
0.13.0
minor
| ||
0.12.4
patch
| ||
0.12.3
patch
| ||
0.12.2
patch
| ||
0.12.1
patch
| ||
0.12.0
minor
| ||
0.11.2
patch
|
1–50 of 84