AI.info
Bin Li
Explore Bin Li on AI.info.
- Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
- Why Attention Patterns Exist: A Unifying Temporal Perspective Analysis
- InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
- Generative Latent Coding for Ultra-Low Bitrate Image Compression
- Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance
- InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
- Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
- CoD: A Diffusion Foundation Model for Image Compression
- OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding
- Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models
- Adaptive Morph-Patch Transformer for Aortic Vessel Segmentation
- KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls
- MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models