FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents Paper • 2608.18423 • Published Aug 19 • 21
Classroom Final Exam: An Instructor-Tested Reasoning Benchmark Paper • 2602.19517 • Published Feb 23 • 4
Classroom Final Exam: An Instructor-Tested Reasoning Benchmark Paper • 2602.19517 • Published Feb 23 • 4
view article Article Red Teaming with RL: Exploiting Tinker API for Harmful RL on 235B Model georgefen • Jan 1 • 19
LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL Paper • 2503.07536 • Published Mar 10, 2025 • 89