Sign in Sign up
cargo

memra-server

Rust + CUDA LLM inference engine for Blackwell (Tuned specifically on RTX PRO 6000, RTX 5090, B200): OpenAI-compatible (+converse and ant) serving, per-model X hardware exactness gates. NVFP4/mixed (fp8 hybrid, 4o6, etc - correctness, performance, hardware specific adapted) main quant support.

Activity

Latest release
5d ago
Total releases
83
Cadence
~daily
Last 12 months
83

Reach

Downloads
1.2k
Stars
1

Details

License
unknown
First release
Aug 04, 2026
Releases
Version Released
0.137.0 minor
0.136.0 minor
0.135.0 minor
0.134.0 minor
0.133.0 minor
0.130.0 minor
0.129.0 minor
0.128.0 minor
0.127.0 minor
0.126.1 patch
0.126.0 minor
0.125.0 minor
0.124.1 patch
0.124.0 minor
0.123.0 minor
0.122.0 minor
0.121.0 minor
0.120.0 minor
0.119.0 minor
0.118.0 minor
0.117.0 minor
0.116.1 patch
0.116.0 minor
0.115.0 minor
0.113.2 patch
0.113.1 patch
0.113.0 minor
0.112.1 patch
0.112.0 minor
0.111.0 minor
0.110.0 minor
0.109.2 patch
0.109.1 patch
0.109.0 minor
0.108.1 patch
0.108.0 minor
0.107.0 minor
0.103.0 minor
0.101.0 minor
0.100.1 patch
0.100.0 minor
0.99.1 patch
0.99.0 minor
0.98.0 minor
0.97.0 minor
0.96.0 minor
0.95.0 minor
0.94.0 minor
0.93.0 minor
0.92.0 minor
1–50 of 83