zhezi12138/Qwen3-4B-formal-r1-RL-50iter-seed42 Reinforcement Learning • 4B • Updated 15 days ago • 24