AI.info
Bin Wang
Explore Bin Wang on AI.info.
- MoDora: Tree-Based Semi-Structured Document Analysis System
- ST4VLA: Spatially Guided Training for Vision-Language-Action Models
- InternAgent-1.5: A Unified Agentic Framework for Long-Horizon Autonomous Scientific Discovery
- DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation
- PTalker: Personalized Speech-Driven 3D Talking Head Animation via Style Disentanglement and Modality Alignment
- DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
- TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition
- Dynamic Gaussian Scene Reconstruction from Unsynchronized Videos
- Beyond Single Images: Retrieval Self-Augmented Unsupervised Camouflaged Object Detection
- ReCon: Region-Controllable Data Augmentation with Rectification and Alignment for Object Detection
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
- FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model