On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics Paper • 2609.35259 • Published 14 days ago • 202
Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively? Paper • 2609.39578 • Published 12 days ago • 72
TERRA: Terrain-Aware Reconstruction, Retargeting and Control for Musculoskeletal Locomotion Paper • 2609.38653 • Published 13 days ago • 39
GUI-HARVEST: Self-Improving GUI Agents through Evidence-Driven Harness Evolution Paper • 2610.00948 • Published 11 days ago • 22
TRACE: Rollout-Guided Quantization-Aware Training for FP4 Reinforcement Learning of MoE Language Models Paper • 2610.07767 • Published 6 days ago • 92
Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding Paper • 2610.07342 • Published 7 days ago • 21
TRIAGE: Direction-Aware Mismatch Stabilization of Native NVFP4 Reinforcement Learning Paper • 2610.07043 • Published 7 days ago • 43
Towards Looped Models Done Right, Part II: Rethinking at Fixed Points Paper • 2610.06833 • Published 7 days ago • 33
LoGRA: Scaling LLM Reinforcement Learning with Low-Rank Gradient Sketches Paper • 2610.06647 • Published 7 days ago • 148
Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation Paper • 2610.05076 • Published 8 days ago • 26
MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning Paper • 2610.02824 • Published 10 days ago • 33
LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models Paper • 2609.39071 • Published 12 days ago • 66
Collective Bias Mitigation via Model Routing and Collaboration Paper • 2610.03240 • Published 10 days ago • 20
Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL Paper • 2609.37200 • Published 13 days ago • 140
Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It Paper • 2609.36585 • Published 13 days ago • 71
The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation Paper • 2609.36484 • Published 13 days ago • 553
BiasReducer: Adaptive Bias Mitigation for Reward Models Paper • 2609.32720 • Published 16 days ago • 26
QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents Paper • 2609.33848 • Published 15 days ago • 47