Léo Martin
leo-mart
·
AI & ML interests
RLHF, RLAIF, offline RL, bandits
Recent Activity
upvoted a paper about 3 hours ago
MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning upvoted a paper about 3 hours ago
RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations upvoted a paper about 16 hours ago
Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RLOrganizations
None yet