Persona2Web: Benchmarking Personalized Web Agents for Contextual Reasoning with User History Paper • 2602.17003 • Published Feb 19 • 1
SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented Generative Engine Optimization Paper • 2602.12187 • Published Feb 12 • 1
BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic Feedback Paper • 2509.21106 • Published Sep 25, 2025 • 8
BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic Feedback Paper • 2509.21106 • Published Sep 25, 2025 • 8
MT-RAIG: Novel Benchmark and Evaluation Framework for Retrieval-Augmented Insight Generation over Multiple Tables Paper • 2502.11735 • Published Feb 17, 2025