conformal-feedback-alignment
RLUF: Reinforcement Learning with Uncertainty Feedback via Conformal Prediction for DPO
Activity
- Latest release
- 5mo ago
- Total releases
- 1
- Cadence
- —
- Last 12 months
- 1
Reach
- Stars
- —
Details
- License
- MIT
- First release
- Mar 25, 2026