Lucas Oliveira
lucasolive
ยท
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a dataset 2 days ago
Srishti280992/repro-exact-unlearning-in-reinforcement-learning-traces liked a dataset 2 days ago
HumanDynamics/reward_modeling_dataset liked a dataset 2 days ago
andersonbcdefg/reward-modeling-eval-tokenizedOrganizations
None yet