Library

Subject
Tags

6,940 matches · cs.MM

#
001Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPOarXivPaperXilin Jiang, Riki Shimizu et al.Yesterday
002HyperClaim: Fine-Grained Cross-Modal Hypergraph Reasoning for Video Misinformation DetectionarXivPaperXiangbo Wang et al.Yesterday
003QQWorld: Quantile-Quantile Matching for World Model RegularizationarXivPaperZhoushun Yu et al.Yesterday
004Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free DistillationarXivPaperSimone Giano et al.Yesterday
005Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise PerspectivesarXivPaperXiaolong Liu, Junjian Li et al.2 days ago
006DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health AssessmentarXivPaperShiyu Teng, Haichen Yu et al.3 days ago
007TRWH: A Text-Driven Random Walk Heterogeneous GNN for Semantic-Aware Sparse RecommendationarXivPaperHe Ma, Chen Liu3 days ago
008Beyond Appearance: A Multi-cue Framework and Large-scale Benchmark for Pedestrian Association and Tracking on Mobile Aerial-Ground PlatformsarXivPaperRuiqi Wu, Bingliang Jiao et al.5 days ago
009Collusion-Resistant Image-Agnostic Watermarking for Multi-Screen ShootingarXivPaperMingyue Chen, Xin Liao et al.5 days ago
010Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-CheckingarXivPaperHaorui He, Xinwen Chen et al.5 days ago
011CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video DiffusionarXivPaperShreshth Saini, N. Birkbeck et al.6 days ago
012Codebook Capacity Governs Perceptual Quality Across Resolutions in Hierarchical Discrete Video CompressionarXivPaperManikanta Kotthapalli, Banafsheh Rekabdar6 days ago
013FedTaste: Topology-Aware Structural Transfer for Multimodal Federated Learning with Missing ModalitiesarXivPaperHaocheng Liang, Jie Zhang et al.6 days ago
014CARA: Concept-Aware Risk Attention for Interpretable Collision AnticipationarXivPaperZhishan Tao, Ruoyu Wang et al.7 days ago
015Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based ExplainabilityarXivPaperAhmed M. Abuzuraiq, Philippe Pasquier7 days ago
016Physiological Signals as a Forensic Modality for Talking-Face Deepfake DetectionarXivPaperPablo Santiago Potes Velasco, María del Mar García Matabanchoy et al.Jul 23
017TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical ObjectsarXivPaperKe Ma, Yifei Wang et al.Jul 23
018Can an AI System Be Creative? A Critical Perspective from Art and EngineeringarXivPaperIvan Magrin-ChagnolleauJul 22
019Child-Oriented AIGC Video Risk Reviewing: A Benchmark and Knowledge-Supported Iterative Reasoning FrameworkarXivPaperLewen Mi, Manyi Li et al.Jul 21
020Code Division Modulation Layers Against Forgetting and Inference in Continual Gait IdentificationarXivPaperSimone MilaniJul 21
021Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and ChallengesarXivPaperTuo Liang, Zhe Hu et al.Jul 21
022Group-of-Latents: Perceptual Video Compression at Extreme Bitrates via Masked Latent Generative ModelingarXivPaperShaokang Wang, Jinchang Xu et al.Jul 21
023Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and EditingarXivPaperXinjie Zhang, Peng Zhang et al.Jul 21
024Keyframe-Anchored Identity Preservation for Sequential-Action Video GenerationarXivPaperZhenjie Liu, Bin Chen et al.Jul 20
025LFM: Leveraging Foundation Models for Source-Free Universal Domain AdaptationarXivPaperJing Li, Pan Liu et al.Jul 20
026OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial AlignmentarXivPaperWenxiao Fan, Hang Yin et al.Jul 20
027Packet-Loss Robust 3D Gaussian Compression via Atomic Packaging and GNN-based Error ConcealmentarXivPaperYuxuan Tao, Xuerui Ma et al.Jul 20
028SGA: Plug&Play Geometric Verification for Educational Video SynthesisarXivPaperLopez Jhon, Hinojosa Carlos et al.Jul 20
029Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation ModelsarXivPaperXingkai Peng, Jun Jiang et al.Jul 19
030EII-SCL: Harnessing Emotional Inertia for Multimodal Emotion Recognition in ConversationarXivPaperZilong Huang, K. Lee et al.Jul 19
031EmoEUS: Uncertainty Supervision for Multimodal Emotion Recognition in ConversationarXivPaperZilong Huang, K. Lee et al.Jul 19
032Semantic Context Matters: Analysis of Color Names Across DomainsarXivPaperAdilet Yerkin, Elnara Kadyrgali et al.Jul 19
033From Modalities to Propositions: A Language-Centric Framework for Multimodal IntelligencearXivPaperNadine Chang, Maying Shen et al.Jul 18
034Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual RealignmentarXivPaperPengxu Chen, Yao Zhu et al.Jul 18
035Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward ModelingarXivPaperBoxin Chang, Yu-Chih ChenJul 17
036Toward Semantic Communication for Real-time Mobile 3D ReconstructionarXivPaperFangzhou Zhao, Yao Sun et al.Jul 17
037SceneBind: Binding What and Where Across Vision, Audio and LanguagearXivPaperMingfei Chen, Zijun Cui et al.Jul 16
038Self-Evolving Human-Centered Framework for Explainable Depression Symptom AnnotationarXivPaperHoang-Loc Cao, Van Pham et al.Jul 16
039Bring Music The Horizon: Music-Driven 360$^\circ$ Video GenerationarXivPaperKai Hsu Tsai, Yongyong Fu et al.Jul 15
040Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMsarXivPaperZhi Zheng, Zheren Fu et al.Jul 15
041Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM BenchmarksarXivPaperJ. LeeJul 14
042Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?arXivPaperKaiwen Zheng, Junchen Fu et al.Jul 14
043Explainable-by-Design Audio Deepfake Detection via Wiener-Hopf Linear PredictionarXivPaperMattia Tamiazzo, Simone Milani et al.Jul 14
044Traceback Translators Against Forgetting in Continual Fake Speech DetectionarXivPaperEnrico Gottardis, Mattia Tamiazzo et al.Jul 14
045What Would You Click? Personalized Video Thumbnail Generation with Preference-aware Highlight RetrievalarXivPaperZhiyu He, Zecheng Zhao et al.Jul 14
046BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape GenerationarXivPaperAjitesh Jamulkar, Aritra HazraJul 13
047LightMem-Ego: Your AI Memory for Everyday LifearXivPaperYijun Chen, Boyi Xiao et al.Jul 13
048MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce SearcharXivPaperZhenlin Chen, Maosen Sheng et al.Jul 13
049Q-BridgeNet: A Quantization Network for Cross-Lingual Sign Language TranslationarXivPaperLiqian Feng, Lintao Wang et al.Jul 13
050Label-Free Target-Domain Adaptation for Unconstrained Event-Image Feature Matching via Dual-Stage DistillationarXivPaperZhonghua Yi et al.Jul 11
051What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer BenchmarksarXivPaperGuanhua Ye, Jingbin Niu et al.Jul 11
052Beyond Metadata: CAPRA for Hidden Subgroup Analysis under Missing Metadata in Medical ImagingarXivPaperYawen Li, Yan Li et al.Jul 10
053Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and AlgorithmsarXivPaperPeipei Zhu, Yueqing Niu et al.Jul 10
054Local Multimodal Music Alignment from Global SupervisionarXivPaperIrmak Bukey, Zachary Novack et al.Jul 10
055MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained UnderstandingarXivPaperKun Li et al.Jul 10
056Scalable Visual Pretraining for Language IntelligencearXivPaperYiming Zhang, Zhonghan Zhao et al.Jul 10
057Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and BenchmarksarXivPaperShubhashis Nobin Sarwar, Roy Dipta et al.Jul 8
058MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data GenerationarXivPaperZhiyuan Zhao, Bin Wang et al.Jul 7
059Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image EditingarXivPaperWanglong Lu, Li Su et al.Jul 7
060WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent EvaluationarXivPaperWei Dong et al.Jul 7

Showing 60 of 6,940 documents · scroll for more