001 SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark arXiv Paper Sania Bano, Shahzad Ahmad et al. Jul 20 002 Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs arXiv Paper Raza Imam, Darakshan Rashid et al. Jul 18 003 Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning arXiv Paper Xiaopeng Zhang, Yueyang Weng et al. Jul 15 004 The Effect of Multi-Lingual and Keyword Adversarial Injection on LLM Relevance Judgment arXiv Paper Nguyen-Thanh-Thao Vo, Duy Duong Tuong et al. Jul 11 005 Dive Into the Implicit Biases of Low-rank Vision-language Alignment arXiv Paper Mingjia Shi, Shuo Wang et al. Jul 9 006 Data Augmentation for L2 English Speaking Assessment using TTS arXiv Paper Stefano Bannò, Penny Karanasou et al. Jul 1 007 Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering arXiv Paper Shuo-Chun Lin, Hen-Hsen Huang Jul 1 008 Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition arXiv Paper Xugang Lu, Peng Shen et al. Jul 1 009 SCOPE: Leveraging Subgoal Critiques for Code Generation arXiv Paper Yueke Zhang, Yifan Zhang et al. Jul 1 010 VIP-MINGLE: A Corpus for Videoconference and In-Person Multimodal Interaction in Group Language Engagement arXiv Paper Andrew Chang, Abhinay K Bodi et al. Jul 1 011 Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning arXiv Paper Yanzhe Tang, Xinyu Shao et al. Jun 24 012 SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation arXiv Paper Hao Su, Yuehao Huang et al. Jun 24 013 Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling arXiv Paper Kun Zhang, Chenxin Fang et al. Jun 23 014 Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval arXiv Paper Duc M. Nguyen, Hieu-Hoc Tran-Minh et al. Jun 18 015 Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement arXiv Paper Kinam Kim, Namiko Saito et al. Jun 17 016 EventDrive: Event Cameras for Vision-Language Driving Intelligence arXiv Paper Dongyue Lu, Rong Li et al. Jun 16 017 ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining arXiv Paper Hao Li, Ganlong Zhao et al. Jun 15 018 DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models arXiv Paper Dingrong Wang, Xian Tao et al. Jun 15 019 GaussTrace: Provenance Analysis of 3D Gaussian Splatting Models with Evidence-based LLM Reasoning arXiv Paper Haoliang Han, Ziyuan Luo et al. Jun 9 020 MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models arXiv Paper Haochen Shi, Weiye Li et al. Jun 8 021 Personalized and Robust Proactive Robot Assistance with Uncertainty-Guided LLM Reasoning arXiv Paper Á. González, M. H. Shovo et al. Jun 7 022 Multimodal Sexism Identification and Characterization using Large Language Models and Gradient Boosting arXiv Paper Kyriakos Chaviaras, Maria Lymperaiou et al. Jun 4 023 Drift-Augmented Scoring: Text-Derived Noise Robustness for Zero-Shot Audio-Language Classification arXiv Paper Tu Vo, S. Zaheer et al. Jun 3 024 OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform arXiv Paper Jinyu Zhang, Luoyi Fan et al. Jun 2 025 BashCoder-R1: Towards Robust and Explainable Bash Code Generation with Robustness-Aware Group Relative Policy Optimization arXiv Paper Lei Yu, Peng Wang et al. Jun 1 026 Missing-Token Prompted Reliability-Aware Fusion for Robust Polyglot Speaker Identification arXiv Paper Peng Jia, Likun Dai et al. Jun 1 027 Qiskit Code Migration with LLMs arXiv Paper José Manuel Suárez, Luís Mariano Bibbó et al. Jun 1 028 QoEReasoner: An Agentic Reasoning Framework for Automated and Explainable QoE Diagnosis in RANs arXiv Paper Qizhe Li, Hao Chen et al. Jun 1 029 SemCEB: A Cardinality Estimation Benchmark for Semantic Operators arXiv Paper Andreas Zimmerer, Claudius Kuhn et al. Jun 1 030 SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing arXiv Paper Hanlin Zhang, Daxin Tan et al. Jun 1 031 Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings arXiv Paper B. So, Jaejun Lee et al. Jun 1 032 FinCom: A Financial Multi-Agent Demo with Disagree-or-Commit Deliberation arXiv Paper Chaojie Yang, Zixiao Tan et al. May 31 033 Agentic Language-to-Objective Synthesis for Optofluidic Assembly arXiv Paper I. Saraev, E. Erben et al. May 26 034 STAMBRIDGE: Spectral-Temporal Amplitude-aware Mid-Feature Bridge for EEG Visual Decoding arXiv Paper Jiahe Meng, Weiming Zeng et al. May 22 035 CLUE: Adaptively Prioritized Contextual Cues by Leveraging a Unified Semantic Map for Effective Zero-Shot Object-Goal Navigation arXiv Paper Taeyun Kim, Alvin Jinsung Choi et al. May 19 036 RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models arXiv Paper Jing-Hua Luo, Yifan Wen et al. May 19 037 LISA: Language-guided Interference-aware Spatial-Frequency Attention for Driver Gaze Estimation arXiv Paper Jun Ma, Zhenye Yang et al. May 17 038 BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning arXiv Paper Rui-Huan Wang, Shuanghao Bai et al. May 13 039 CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding arXiv Paper Hanwen Zhang, Yaofang Liu et al. May 13 040 WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments arXiv Paper Hao Zhao, Tianyi Chen et al. May 13 041 CheXTemporal: A Dataset for Temporally-Grounded Reasoning in Chest Radiography arXiv Paper E. Prakash, Yunhe Gao et al. May 11 042 A General Framework for Multimodal LLM-Based Multimedia Understanding in Large-Scale Recommendation Systems arXiv Paper Yiming Zhu, Xu Liu et al. May 10 043 Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning arXiv Paper Xia Yang, Xuanyi Zhang et al. May 10 044 DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification arXiv Paper Rui Liu, Dian Yu et al. May 10 045 How Much is Brain Data Worth for Machine Learning? arXiv Paper Lane Lewis, Zhixin Wang et al. May 10 046 NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning arXiv Paper Tiehan Cui, Peipei Liu et al. May 10 047 Budgeted Subset Refinement for Execution-Aware LLM Research Ideation arXiv Paper Michael Zhang May 9 048 POETS: Uncertainty-Aware LLM Optimization via Compute-Efficient Policy Ensembles arXiv Paper Nicolas Menet, Andreas Krause et al. May 8 049 Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients arXiv Paper Mingwei Xu, Hao Fang May 7 050 FedAttr: Towards Privacy-preserving Client-Level Attribution in Federated LLM Fine-tuning arXiv Paper Suanyuan Zhang, Junfeng Guo et al. May 7 051 From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms arXiv Paper Jing Luo, Yuchen Tian et al. May 7 052 Layer Collapse in Diffusion Language Models arXiv Paper A. Conzelmann, Albert Catalan-Tatjer et al. May 7 053 MELD: Multi-Task Equilibrated Learning Detector for AI-Generated Text arXiv Paper Chenjun Li, Chengcheng Wan et al. May 7 054 On the Role of Language Representations in Auto-Bidding: Findings and Implications arXiv Paper Guanyu Zhu, Jining Luan et al. May 7 055 Reward Shaping and Action Masking for Compositional Tasks using Behavior Trees and LLMs arXiv Paper Nicholas Potteiger, Ankita Samaddar et al. May 7 056 CANDI: Contextual Alignment for Niche Domains Question Answering arXiv Paper Megha Chakraborty, Darssan Eswaramoorthi et al. May 6 057 Automatic Reflection Level Classification in Hungarian Student Essays arXiv Paper Zsolt Csibi, Mónika Sándor et al. May 4 058 Understanding Asynchronous Inference Methods for Vision-Language-Action Models arXiv Paper Ayoub Agouzoul May 4 059 FIRCE: A Framework for Intrusion Response and Conformal Evaluation arXiv Paper Seth Barrett, Lin Li et al. May 3 060 Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models arXiv Paper Yuriel Ryan, Hei Man Ip et al. May 3