AI.info
Haochen Wang
Explore Haochen Wang on AI.info.
- SAMTok: Representing Any Mask with Two Words
- CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
- Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs