AI.info
Haoli Bai
Explore Haoli Bai on AI.info.
- OptiMAS: Automatically Optimize Multi-Agent System
- From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
- What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
- Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents
- HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs
- MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models