AI.info
Bo An
Explore Bo An on AI.info.
- Entropy-Regularized Rank-Masked Policy Optimization for Test-Time Reinforcement Learning in Code Generation
- Two-Stage Reinforcement Learning for Sound and Adversarial Test Generation in Code LLMs
- Harnessing Reasoning Trajectories for Hallucination Detection via Answer-agreement Representation Shaping
- Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation
- AgentOCR: Reimagining Agent History via Optical Self-Compression
- Training Diffusion Policies via Prior-Mapping Co-Evolution
- Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning