EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction Paper • 2609.02783 • Published 3 days ago • 113
ParaTempo: Efficient Parallel Reasoning via Temporal Confidence Paper • 2608.16425 • Published 18 days ago • 40
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring Paper • 2608.09802 • Published 26 days ago • 134
SWE-Explore: Benchmarking How Coding Agents Explore Repositories Paper • 2606.07297 • Published Jun 5 • 124