RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 9 days ago • 277
Covert Assistance: Helpful LLM Agents Evade Oversight in Multi-Agent Systems Paper • 2609.39050 • Published 10 days ago • 18
Dream4ACT: A Shared Visual Action Interface for Multi-Embodiment Video-Action Modeling Paper • 2609.40153 • Published 10 days ago • 11
Smaller Models, Better Rejects: Preference Distillation Scaling Paper • 2609.38987 • Published 10 days ago • 29
Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs Paper • 2609.32259 • Published 11 days ago • 96
AutoDataBench: A Data-centric Testbed for Accelerating Auto Research Paper • 2609.40097 • Published 10 days ago • 46
Predictive Credit: Measuring What Scientific Explanations Add to Experimental Forecasts Paper • 2610.00314 • Published 11 days ago • 102