AI.info
Latest Research — Page 126
Browse Latest Research on AI.info.
- Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion
- Your Autoregressive Model Already Reveals the Causal Graph
- MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
- AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning
- TRIM: Scalable 3D Gaussian Diffusion Inference with Temporal and Spatial Trimming
- What, Where, and How: Disentangling the Roles of Task, Language, and Model in Code Model Representations
- MASCOT: Multi-Agent Socio-Collaborative Companion Systems
- CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes
- iDETEX: Empowering MLLMs for Intelligent DETailed EXplainable IQA
- ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
- Nonlinear Noise2Noise for Efficient Monte Carlo Denoiser Training
- PriorGuide: Test-Time Prior Adaptation for Simulation-Based Inference
- RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks
- Learning the relative composition of EEG signals using pairwise relative shift pretraining
- UBone3D: Physics-Rectified Conditional Flow Matching for Anatomical 3D Shape Completion from Ultrasound
- VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
- Sound-based Multi-Person 3D Pose Estimation
- MoSE: Mixture of Slimmable Experts for Efficient and Adaptive Language Models
- BitLogic: Training Framework for Gradient-Based FPGA-Native Neural Networks
- Capture, Canonicalize, Splat: Zero-Shot 3D Gaussian Avatars from Unstructured Phone Images
- User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios
- GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
- Learning Unmasking Policies for Diffusion Language Models
- Learning When to Jump for Off-road Navigation
- Phi-Actor-Critic: Steering General-Sum Games to Pareto-Efficient Correlated Equilibria
- Conformal Calibration Transfer
- MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
- WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving
- ATCion: Exploring the Design of Icon-based Visual Aids for Enhancing In-cockpit Air Traffic Control Communication
- Graph-Based Exploration for ARC-AGI-3 Interactive Reasoning Tasks
- Missing the Margins: A Systematic Literature Review on the Demographic Representativeness of LLMs
- Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO
- GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
- Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning
- Optimizer choice matters for the emergence of Neural Collapse
- Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning
- Reusing Latent Speech Representations for Query-Conditioned Topic Localization in Transcripts
- HVAdam: A Full-Dimension Adaptive Optimizer
- Sound Logical Explanations for Mean Aggregation Graph Neural Networks
- SurfSplat: Conquering Feedforward 2D Gaussian Splatting with Surface Continuity Priors