AI.info
Pengfei Wan
Explore Pengfei Wan on AI.info.
- PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
- StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation
- TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions
- Stable Velocity: A Variance Perspective on Flow Matching
- OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
- From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping
- Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment
- GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
- SVG-T2I: Scaling Up Text-to-Image Latent Diffusion Model Without Variational Autoencoder
- FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion
- Astra: General Interactive World Model with Autoregressive Denoising
- Monet: Reasoning in Latent Visual Space Beyond Images and Language
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- VidEmo: Affective-Tree Reasoning for Emotion-Centric Video Foundation Models
- OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes
- Latent Diffusion Model without Variational Autoencoder