Sign in Sign up
cargo

memra-sampling

Rust + CUDA LLM inference engine for Blackwell (Tuned specifically on RTX PRO 6000, RTX 5090, B200): OpenAI-compatible (+converse and ant) serving, per-model X hardware exactness gates. NVFP4/mixed (fp8 hybrid, 4o6, etc - correctness, performance, hardware specific adapted) main quant support.

Activity

Latest release
3d ago
Total releases
87
Cadence
~daily
Last 12 months
87

Reach

Downloads
1.9k
Stars
1

Details

License
unknown
First release
Aug 04, 2026
Releases
Version Released
0.138.0 minor
0.137.0 minor
0.136.0 minor
0.135.0 minor
0.134.0 minor
0.133.0 minor
0.132.0 minor
0.131.0 minor
0.130.0 minor
0.129.0 minor
0.128.0 minor
0.127.0 minor
0.126.1 patch
0.126.0 minor
0.125.0 minor
0.124.1 patch
0.124.0 minor
0.123.0 minor
0.122.0 minor
0.121.0 minor
0.120.0 minor
0.119.0 minor
0.118.0 minor
0.117.0 minor
0.116.1 patch
0.116.0 minor
0.115.0 minor
0.113.2 patch
0.113.1 patch
0.113.0 minor
0.112.1 patch
0.112.0 minor
0.111.0 minor
0.110.0 minor
0.109.2 patch
0.109.1 patch
0.109.0 minor
0.108.1 patch
0.108.0 minor
0.107.0 minor
0.106.0 minor
0.103.0 minor
0.101.0 minor
0.100.1 patch
0.100.0 minor
0.99.1 patch
0.99.0 minor
0.98.0 minor
0.97.0 minor
0.96.0 minor
1–50 of 87