AI.info
Yang Shi
Explore Yang Shi on AI.info.
- RefCaptioner: Multi-Reference Image-Grounded Video Captioning
- BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents
- OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
- MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
- GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
- Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling
- Monet: Reasoning in Latent Visual Space Beyond Images and Language
- PC-UNet: An Enforcing Poisson Statistics U-Net for Positron Emission Tomography Denoising