Léo Martin
leo-mart
·
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
upvoted a paper 4 days ago
Scaling Properties of Same-Family On-Policy Distillation upvoted a paper 4 days ago
SoL-Refiner: Speed-of-Light One-Step Refinement for High-Resolution Video liked a dataset 5 days ago
OpenMOSS-Team/hh-rlhf-strength-cleanedOrganizations
None yet