Léo Martin
leo-mart
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a dataset 1 day ago
Anthropic/hh-rlhf liked a dataset 1 day ago
Dahoas/full-hh-rlhf upvoted a paper 1 day ago
Scaling Automatic Research Agents via World ModelsOrganizations
None yet