AI.info
Xiang Bai
Explore Xiang Bai on AI.info.
- SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
- TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
- AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning
- When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models
- ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
- MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning
- Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution
- URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model
- NAUTILUS: A Large Multimodal Model for Underwater Scene Understanding
- More Than Generation: Unifying Generation and Depth Estimation via Text-to-Image Diffusion Models