EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation Paper • 2601.06565 • Published Apr 7 • 1
Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training? Paper • 2604.10547 • Published May 13 • 1