Ian Cole
codingiancole
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a dataset about 6 hours ago
andersonbcdefg/sharegpt_reward_modeling_pairwise liked a dataset about 6 hours ago
introvoyz041/reinforcement-learning liked a dataset about 6 hours ago
Srishti280992/repro-exact-unlearning-in-reinforcement-learning-tracesOrganizations
None yet