AI.info
Lifeng Shang
Explore Lifeng Shang on AI.info.
- InfMem: Learning System-2 Memory Control for Long-Context Agent
- From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
- Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents
- Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning