RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 6 days ago • 274
Science Utopia? Closed-Loop LLM Simulation of Academic Research Ecosystems Paper • 2610.01257 • Published 6 days ago • 41
EditHero: A Benchmark for Long-Horizon Part-Level 3D Editing and Vibe Modeling Paper • 2610.02298 • Published 6 days ago • 53
Multilingual GSM-Symbolic: What determines capability transfer across languages? Paper • 2610.03367 • Published 5 days ago • 47
Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively? Paper • 2609.39578 • Published 7 days ago • 68
ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing Paper • 2609.38541 • Published 8 days ago • 32
Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence Paper • 2609.34563 • Published 9 days ago • 217