001 Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO arXiv Paper Xilin Jiang, Riki Shimizu et al. Yesterday 002 HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation Detection arXiv Paper Xiangbo Wang et al. Yesterday 003 QQWorld: Quantile-Quantile Matching for World Model Regularization arXiv Paper Zhoushun Yu et al. Yesterday 004 Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation arXiv Paper Simone Giano et al. Yesterday 005 Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives arXiv Paper Xiaolong Liu, Junjian Li et al. 2 days ago 006 DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment arXiv Paper Shiyu Teng, Haichen Yu et al. 3 days ago 007 TRWH: A Text-Driven Random Walk Heterogeneous GNN for Semantic-Aware Sparse Recommendation arXiv Paper He Ma, Chen Liu 3 days ago 008 Beyond Appearance: A Multi-cue Framework and Large-scale Benchmark for Pedestrian Association and Tracking on Mobile Aerial-Ground Platforms arXiv Paper Ruiqi Wu, Bingliang Jiao et al. 5 days ago 009 Collusion-Resistant Image-Agnostic Watermarking for Multi-Screen Shooting arXiv Paper Mingyue Chen, Xin Liao et al. 5 days ago 010 Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking arXiv Paper Haorui He, Xinwen Chen et al. 5 days ago 011 CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion arXiv Paper Shreshth Saini, N. Birkbeck et al. 6 days ago 012 Codebook Capacity Governs Perceptual Quality Across Resolutions in Hierarchical Discrete Video Compression arXiv Paper Manikanta Kotthapalli, Banafsheh Rekabdar 6 days ago 013 FedTaste: Topology-Aware Structural Transfer for Multimodal Federated Learning with Missing Modalities arXiv Paper Haocheng Liang, Jie Zhang et al. 6 days ago 014 CARA: Concept-Aware Risk Attention for Interpretable Collision Anticipation arXiv Paper Zhishan Tao, Ruoyu Wang et al. 7 days ago 015 Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability arXiv Paper Ahmed M. Abuzuraiq, Philippe Pasquier 7 days ago 016 Physiological Signals as a Forensic Modality for Talking-Face Deepfake Detection arXiv Paper Pablo Santiago Potes Velasco, María del Mar García Matabanchoy et al. Jul 23 017 TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects arXiv Paper Ke Ma, Yifei Wang et al. Jul 23 018 Can an AI System Be Creative? A Critical Perspective from Art and Engineering arXiv Paper Ivan Magrin-Chagnolleau Jul 22 019 Child-Oriented AIGC Video Risk Reviewing: A Benchmark and Knowledge-Supported Iterative Reasoning Framework arXiv Paper Lewen Mi, Manyi Li et al. Jul 21 020 Code Division Modulation Layers Against Forgetting and Inference in Continual Gait Identification arXiv Paper Simone Milani Jul 21 021 Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges arXiv Paper Tuo Liang, Zhe Hu et al. Jul 21 022 Group-of-Latents: Perceptual Video Compression at Extreme Bitrates via Masked Latent Generative Modeling arXiv Paper Shaokang Wang, Jinchang Xu et al. Jul 21 023 Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing arXiv Paper Xinjie Zhang, Peng Zhang et al. Jul 21 024 Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation arXiv Paper Zhenjie Liu, Bin Chen et al. Jul 20 025 LFM: Leveraging Foundation Models for Source-Free Universal Domain Adaptation arXiv Paper Jing Li, Pan Liu et al. Jul 20 026 OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment arXiv Paper Wenxiao Fan, Hang Yin et al. Jul 20 027 Packet-Loss Robust 3D Gaussian Compression via Atomic Packaging and GNN-based Error Concealment arXiv Paper Yuxuan Tao, Xuerui Ma et al. Jul 20 028 SGA: Plug&Play Geometric Verification for Educational Video Synthesis arXiv Paper Lopez Jhon, Hinojosa Carlos et al. Jul 20 029 Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models arXiv Paper Xingkai Peng, Jun Jiang et al. Jul 19 030 EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in Conversation arXiv Paper Zilong Huang, K. Lee et al. Jul 19 031 EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in Conversation arXiv Paper Zilong Huang, K. Lee et al. Jul 19 032 Semantic Context Matters: Analysis of Color Names Across Domains arXiv Paper Adilet Yerkin, Elnara Kadyrgali et al. Jul 19 033 From Modalities to Propositions: A Language-Centric Framework for Multimodal Intelligence arXiv Paper Nadine Chang, Maying Shen et al. Jul 18 034 Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment arXiv Paper Pengxu Chen, Yao Zhu et al. Jul 18 035 Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling arXiv Paper Boxin Chang, Yu-Chih Chen Jul 17 036 Toward Semantic Communication for Real-time Mobile 3D Reconstruction arXiv Paper Fangzhou Zhao, Yao Sun et al. Jul 17 037 SceneBind: Binding What and Where Across Vision, Audio and Language arXiv Paper Mingfei Chen, Zijun Cui et al. Jul 16 038 Self-Evolving Human-Centered Framework for Explainable Depression Symptom Annotation arXiv Paper Hoang-Loc Cao, Van Pham et al. Jul 16 039 Bring Music The Horizon: Music-Driven 360$^\circ$ Video Generation arXiv Paper Kai Hsu Tsai, Yongyong Fu et al. Jul 15 040 Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs arXiv Paper Zhi Zheng, Zheren Fu et al. Jul 15 041 Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks arXiv Paper J. Lee Jul 14 042 Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters? arXiv Paper Kaiwen Zheng, Junchen Fu et al. Jul 14 043 Explainable-by-Design Audio Deepfake Detection via Wiener-Hopf Linear Prediction arXiv Paper Mattia Tamiazzo, Simone Milani et al. Jul 14 044 Traceback Translators Against Forgetting in Continual Fake Speech Detection arXiv Paper Enrico Gottardis, Mattia Tamiazzo et al. Jul 14 045 What Would You Click? Personalized Video Thumbnail Generation with Preference-aware Highlight Retrieval arXiv Paper Zhiyu He, Zecheng Zhao et al. Jul 14 046 BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation arXiv Paper Ajitesh Jamulkar, Aritra Hazra Jul 13 047 LightMem-Ego: Your AI Memory for Everyday Life arXiv Paper Yijun Chen, Boyi Xiao et al. Jul 13 048 MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search arXiv Paper Zhenlin Chen, Maosen Sheng et al. Jul 13 049 Q-BridgeNet: A Quantization Network for Cross-Lingual Sign Language Translation arXiv Paper Liqian Feng, Lintao Wang et al. Jul 13 050 Label-Free Target-Domain Adaptation for Unconstrained Event-Image Feature Matching via Dual-Stage Distillation arXiv Paper Zhonghua Yi et al. Jul 11 051 What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks arXiv Paper Guanhua Ye, Jingbin Niu et al. Jul 11 052 Beyond Metadata: CAPRA for Hidden Subgroup Analysis under Missing Metadata in Medical Imaging arXiv Paper Yawen Li, Yan Li et al. Jul 10 053 Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms arXiv Paper Peipei Zhu, Yueqing Niu et al. Jul 10 054 Local Multimodal Music Alignment from Global Supervision arXiv Paper Irmak Bukey, Zachary Novack et al. Jul 10 055 MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained Understanding arXiv Paper Kun Li et al. Jul 10 056 Scalable Visual Pretraining for Language Intelligence arXiv Paper Yiming Zhang, Zhonghan Zhao et al. Jul 10 057 Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks arXiv Paper Shubhashis Nobin Sarwar, Roy Dipta et al. Jul 8 058 MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation arXiv Paper Zhiyuan Zhao, Bin Wang et al. Jul 7 059 Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing arXiv Paper Wanglong Lu, Li Su et al. Jul 7 060 WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation arXiv Paper Wei Dong et al. Jul 7