Ian Cole
codingiancole
AI & ML interests
Reinforcement learning, reward modeling, RLHF, policy optimization, offline RL
Recent Activity
upvoted a paper 16 minutes ago
One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation upvoted a paper 16 minutes ago
Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation liked a model about 23 hours ago
JonusNattapong/Reinforcement-Learning-for-Gold-Trading-ModelOrganizations
None yet