Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs Paper • 2609.11499 • Published 1 day ago • 4
EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents Paper • 2609.05903 • Published 6 days ago • 33
SenseNova-U1.5: Towards Native Unified Visual Intelligence Paper • 2609.11929 • Published 1 day ago • 78
NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction Paper • 2609.10715 • Published 2 days ago • 99
PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents Paper • 2609.06702 • Published 5 days ago • 12
Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs Paper • 2609.10355 • Published 2 days ago • 5
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks Paper • 2609.11042 • Published 1 day ago • 34
SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators Paper • 2609.09155 • Published 3 days ago • 12
SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents Paper • 2609.08149 • Published 3 days ago • 20
WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data Paper • 2609.05405 • Published 7 days ago • 31
SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research? Paper • 2609.09113 • Published 3 days ago • 16
Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails Paper • 2609.09134 • Published 3 days ago • 4
DianShi-RxnDB: A Large-Scale, Fine-Grained Organic Reaction Data Platform Built via a Fully Automated Pipeline for Researchers and AI Agents Paper • 2609.06703 • Published 5 days ago • 9
Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them? Paper • 2609.10226 • Published 2 days ago • 9
EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness? Paper • 2609.04280 • Published 8 days ago • 5