AI.info
Latest Research — Page 62
Browse Latest Research on AI.info.
- Multi-Scale High-Resolution Logarithmic Grapher Module for Efficient Vision GNNs
- MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models
- ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
- Parameters as Experts: Adapting Vision Models with Dynamic Parameter Routing
- Towards Robust Zero-Shot Reinforcement Learning
- Adaptive Morph-Patch Transformer for Aortic Vessel Segmentation
- Real-Time Control-Constrained DDP for Underactuated Balancing of Legged Robots
- Benchmarking LLM Tool-Use in the Wild
- SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
- Neuro-Symbolic Synergy for World Modeling
- RefCaptioner: Multi-Reference Image-Grounded Video Captioning
- PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
- Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
- Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning
- MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus
- Mitigating Negative Flips via Margin Preserving Training
- Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance
- An arithmetic method algorithm optimizing k-nearest neighbors compared to regression algorithms and evaluated on real world data sources
- What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data
- A Survey of Agent Memory in the Second Half: Towards Self-Evolving and Long-Horizon Agents
- What do Geometric Hallucination Detection Metrics Actually Measure?
- How Much is a Human Right Worth? ECtHR-NPD: A Benchmark for Predicting Non-Pecuniary Damage Awards
- Bare-Metal Tensor Virtualization: Overcoming the Memory Wall in Edge-AI Inference on ARM64
- Leveraging the Cross-Domain & Cross-Linguistic Corpus for Low Resource NMT: A Case Study On Bhili-Hindi-English Parallel Corpus
- RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
- Names Don't Matter: Symbol-Invariant Transformer for Open-Vocabulary Learning
- EduDial: Constructing a Large-scale Multi-turn Teacher-Student Dialogue Corpus
- Who Argues What? Joint Argument-Entity Detection and Classification in Political Debates
- MIRO: MultI-Reward cOnditioned pretraining improves T2I quality and efficiency
- Query-Efficient Agentic Graph Extraction Attacks on GraphRAG Systems
- DetectiumFire: A Comprehensive Multi-modal Dataset Bridging Vision and Language for Fire Understanding
- Generalization Bounds for Semi-supervised Matrix Completion with Distributional Side Information
- Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies
- X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and A Novel LLM-consulted Explanation Framework
- NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration
- 4DPC$^2$hat: Towards Dynamic Point Cloud Understanding with Failure-Aware Bootstrapping
- Does the Data Processing Inequality Reflect Practice? On the Utility of Low-Level Tasks
- Mass Concept Erasure in Diffusion Models with Concept Hierarchy
- HumanLLM: Benchmarking and Improving LLM Anthropomorphism via Human Cognitive Patterns
- Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View