Skip to content
AI.info
News
Tools
Research
Learn
AI.info
Rongzhi Zhang
Explore Rongzhi Zhang on AI.info.
Rufus-Air: An Open LLM Post-Training Recipe
HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
Instant Personalized Large Language Model Adaptation via Hypernetwork
Page 1