Meera Joshi
mjoshi-01
ยท
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a dataset about 9 hours ago
beyond/rlhf-reward-single-round-trans_chinese liked a dataset about 9 hours ago
andersonbcdefg/reward-modeling-long-tokenized liked a dataset about 9 hours ago
luckeciano/pku-llama3.1-8b-dataset-features-gt-reward-modelingOrganizations
None yet