Léo Martin
leo-mart
·
AI & ML interests
RLHF, RLAIF, offline RL, bandits
Recent Activity
upvoted a paper about 10 hours ago
MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning upvoted a paper about 10 hours ago
RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations upvoted a paper about 23 hours ago
Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RLOrganizations
None yet