OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution Paper • 2608.00677 • Published 14 days ago • 252
360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents Paper • 2608.08814 • Published 6 days ago • 10
ChronoVision: Temporal Reasoning via Latent State Reconstruction Paper • 2608.05631 • Published 9 days ago • 40
GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? Paper • 2608.05747 • Published 9 days ago • 46
When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills Paper • 2608.03700 • Published 11 days ago • 9
PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning Paper • 2608.01837 • Published 12 days ago • 38
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction Paper • 2607.29677 • Published 15 days ago • 24