Meera Joshi
mjoshi-01
ยท
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
upvoted a paper about 12 hours ago
StudentSim: Training LLM-based Student Simulators upvoted a paper about 12 hours ago
Bellman Policy Optimization liked a dataset about 18 hours ago
kunishou/hh-rlhf-49k-jaOrganizations
None yet