Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants Paper • 2607.26611 • Published Jul 29 • 33
Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists Paper • 2607.11079 • Published Jul 13 • 10