CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation Paper • 2609.04083 • Published 8 days ago • 26
GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments Paper • 2609.00048 • Published 12 days ago • 8
PaperGym: Rubric-Centered Evolution for Research-Plan Generation Paper • 2608.31119 • Published 11 days ago • 41
UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City Paper • 2608.27456 • Published 15 days ago • 112
Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments Paper • 2608.24099 • Published 17 days ago • 12
Intern-S2-Preview: Scientific Agentic Foundation Model Paper • 2608.13505 • Published 29 days ago • 72
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development Paper • 2608.13417 • Published 29 days ago • 58
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains Paper • 2608.09873 • Published Aug 10 • 29
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Paper • 2607.28609 • Published Jul 30 • 73
Metacognition in LLMs: Foundations, Progress, and Opportunities Paper • 2607.11881 • Published Jul 13 • 30