Skip to content
AI.info
News
Tools
Research
Learn
AI.info
Haoru Tan
Explore Haoru Tan on AI.info.
Dynamic Important Example Mining for Reinforcement Finetuning
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
SmartSwitch: Advancing LLM Reasoning by Overcoming Underthinking via Promoting Deeper Thought Exploration
Page 1