AI.info
Yuanxing Zhang
Explore Yuanxing Zhang on AI.info.
- RefCaptioner: Multi-Reference Image-Grounded Video Captioning
- TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
- OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
- T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
- Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
- SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
- Monet: Reasoning in Latent Visual Space Beyond Images and Language
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- IF-VidCap: Can Video Caption Models Follow Instructions?
- MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues