Ian Cole
codingiancole
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
liked a model about 10 hours ago
nvidia/nemotron-3-8b-chat-4k-rlhf liked a model about 10 hours ago
RLHFlow/ArmoRM-Llama3-8B-v0.1 liked a model about 10 hours ago
Anandbheesetti/Lunar_Lander_By_using_reinforcement_learningOrganizations
None yet