jarguello76/reinforcement_learning_lunar_landing Reinforcement Learning • Updated Aug 17, 2025 • 1 • 3
ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals Paper • 2609.16816 • Published 6 days ago • 8
PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents Paper • 2609.06702 • Published 15 days ago • 25
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks Paper • 2609.11042 • Published 11 days ago • 61
andersonbcdefg/sharegpt_reward_modeling_pairwise_no_as_an_ai Viewer • Updated Jun 6, 2023 • 11.8k • 82 • 2
Drift-Constrained Optimization: Only Direction Matters in Fine-Tuning Instruct Models Paper • 2609.13680 • Published 9 days ago • 11
ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents Paper • 2609.17523 • Published 6 days ago • 27
Continual Learning Mechanisms Compose for Long-Horizon Memorization Paper • 2609.06986 • Published 14 days ago • 354
andersonbcdefg/red_teaming_reward_modeling_pairwise_no_as_an_ai Viewer • Updated Jun 1, 2023 • 35.3k • 69 • 3
jaehyeokdoo2/openpi-droid-pnpcarrot-singetask-qflow-offlinerl-criticwarmup2000-alpha100-bs8-test Updated Mar 4 • 1
Expert-Space Exploration in MoE Reinforcement Learning Paper • 2609.13058 • Published 10 days ago • 7
MInTRL: Off-policy Intervention can boost On-policy RL Paper • 2609.12419 • Published 10 days ago • 12
Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training Paper • 2609.15051 • Published 7 days ago • 14