AI.info
Xinbing Wang
Explore Xinbing Wang on AI.info.
- Flow of Spans: Generalizing Language Models to Dynamic Span-Vocabulary via GFlowNets
- Extreme Value Policy Optimization for Safe Reinforcement Learning
- Controlling Underestimation Bias in Constrained Reinforcement Learning for Safe Exploration
- AWM: Accurate Weight-Matrix Fingerprint for Large Language Models