001 SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark arXiv Paper Sania Bano, Shahzad Ahmad et al. Jul 20 002 Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment arXiv Paper Zixiang Zhou, Zhentao Yu et al. Jul 5 003 Reward Lightning: Fast Video Generation via Homologous Preference Distillation arXiv Paper Jiaxiang Cheng, Bing Ma et al. Jul 4 004 DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation arXiv Paper Zijun Li, Yimin Zhou et al. Jul 2 005 AlterAtlas: Shifting Travel Planning from AI Generation to Validation via Persona-Driven Simulations arXiv Paper William Huang, Ruofei Du et al. Jul 1 006 Flow-PIN: A Two-Stage Power-Flow-Guided Method for System-Wide Multivariate Profile Inpainting in Distribution Networks arXiv Paper Zhenghao Zhou, Yiyan Li et al. Jul 1 007 From Chaos to Clarity: A Framework for Program-Level AI Learning Outcomes arXiv Paper Grace Barkhuff, Ian Pruitt et al. Jul 1 008 Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention arXiv Paper Siyu Wu, Linjing You et al. Jun 25 009 Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval arXiv Paper Duc M. Nguyen, Hieu-Hoc Tran-Minh et al. Jun 18 010 Admittance-Based Surface Alignment for Human-in-the-Loop Robotic Visual Inspection arXiv Paper Antara Banerjee, Colin Acton et al. Jun 17 011 V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos arXiv Paper Kai Chen, Yanming Shao et al. Jun 15 012 Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams arXiv Paper Yun Wang, Junbin Xiao et al. Jun 13 013 AnimaSpark: A Feed-Forward Method for Animating Arbitrary 3D Objects arXiv Paper Yiming Zhao, Haoyu Sun et al. Jun 9 014 Toward Human-Centered Multi-Agent Systems: Integrating Cognition, Culture, Values, and Cooperation in AI Agents arXiv Paper Safia Baloch, Rahemeen Khan Jun 6 015 Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning arXiv Paper Ziyang Yao, Haochen Liu et al. Jun 4 016 ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition arXiv Paper Pablo Ayuso-Albizu, Pablo Carballeira et al. Jun 4 017 Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting arXiv Paper Junkun Yuan, YuTao Shen et al. Jun 2 018 A Sheaf Framework for Strategic Multi-Agent Systems: From Consensus to Nash Equilibria arXiv Paper M. Hernandez,, E. Sánchez-Soto Jun 1 019 Matter to Mechanism: A Benchmark for AI Co-Scientists in Materials and Battery Research arXiv Paper Shashwat Sourav, Tanjin He et al. Jun 1 020 Parity Selection Rule for Information and Dissipation in Driven Steady States arXiv Paper Mengqi Li, Lixin Li et al. Jun 1 021 Vibe Coding for Visualization Implementation: An Empirical Study of Practices and Challenges arXiv Paper Zhengyu Sun, Xiaolin Wen et al. Jun 1 022 Wearable Single-Lead ECG Detects Fine-Grained Structural Heart Disease Through Echo-Report Supervision arXiv Paper Chenyang He, Qinghao Zhao et al. Jun 1 023 Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization arXiv Paper Zhuohan Liu, Wujian Peng et al. May 27 024 RAG-Match: Retrieval-Augmented Knowledge Injection and Hierarchical Reasoning for Calibrated Semantic Relevance arXiv Paper He Jiang, Liansheng Sun et al. May 25 025 Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences arXiv Paper Baolu Li, Yuliang Xiu et al. May 25 026 QwenSafe: Multimodal Content Rating Description Identification via Preference-Aligned VLMs arXiv Paper Dishanika Denipitiyage, Aruna Seneviratne et al. May 20 027 Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls arXiv Paper A. Radi, Kunyang Li et al. May 19 028 Self-Creative Text-to-Object Generation using Semantic-Aware Spatial Weighting arXiv Paper Yue Yu, Haibo Chen et al. May 19 029 Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction arXiv Paper Chaoqun He, Ming Xiang et al. May 17 030 Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending arXiv Paper Jingqi Hou, Hongtian Wang May 16 031 Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models? arXiv Paper Renye Yan, Jikang Cheng et al. May 15 032 MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos arXiv Paper Anh-Tai Pham-Nguyen, Tung-Duong Le-Duc et al. May 15 033 Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models arXiv Paper Yujun Tong, Dongliang Chang et al. May 15 034 Towards Continuous Sign Language Conversation from Isolated Signs arXiv Paper Young Min Kim, K. Choo et al. May 14 035 Pareto-Guided Optimal Transport for Multi-Reward Alignment arXiv Paper Ying Ba, Tianyu Zhang et al. May 13 036 Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention arXiv Paper H. Durrani, Rafay Suleman Durrani May 12 037 SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning arXiv Paper Xin Cheng, Xihua Wang et al. May 12 038 Attention Sinks in Diffusion Transformers: A Causal Analysis arXiv Paper Fangzheng Wu, Brian Summa May 10 039 TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment arXiv Paper Jiaming Li, Chenyu Zhu et al. May 9 040 Accurate and Efficient Statistical Testing for Word Semantic Breadth arXiv Paper Yo Ehara May 8 041 Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria arXiv Paper Juanxi Tian, Fengyuan Liu et al. May 8 042 Confidence-Aware Alignment Makes Reasoning LLMs More Reliable arXiv Paper Kejia Chen, Jiawen Zhang et al. May 8 043 Decoupling Semantics and Fingerprints: A Universal Representation for AI-Generated Image Detection arXiv Paper Zhiyuan Wang, Yanxiang Chen et al. May 8 044 Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers arXiv Paper Jingyuan Zhu, Biaolong Chen et al. May 8 045 Flow-OPD: On-Policy Distillation for Flow Matching Models arXiv Paper Zhen Fang, Wenxuan Huang et al. May 8 046 Implicit Preference Alignment for Human Image Animation arXiv Paper Yuanzhi Wang, Xuhua Ren et al. May 8 047 Playing games with knowledge: AI-Induced delusions need game theoretic interventions arXiv Paper Will Beaumaster, Paul Schrater May 8 048 Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners arXiv Paper Botos Csaba, Sreejan Kumar et al. May 8 049 Seed Hijacking of LLM Sampling and Quantum Random Number Defense arXiv Paper Ziyang You, Xiaoke Yang et al. May 8 050 Theoretical Limits of Language Model Alignment arXiv Paper Lucas Monteiro Paes, Natalie Mackraz et al. May 8 051 Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization arXiv Paper Yurui Pan, Ke Xu et al. May 8 052 A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment arXiv Paper Hao Yu May 7 053 AI-Generated Images: What Humans and Machines See When They Look at the Same Image arXiv Paper Silvia Poletti, Justin Ilyes et al. May 7 054 Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models arXiv Paper Zhikai Li, Yue Zhao et al. May 7 055 Continuous-Time Distribution Matching for Few-Step Diffusion Distillation arXiv Paper Tao Liu, Hao Yan et al. May 7 056 How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment arXiv Paper Rui Zhu, Weiheng Bai et al. May 7 057 MAPS: Modeling Co-Existing Subjective Perspectives and Shared Meaning in Multi-Agent Cognitive Dialogue arXiv Paper Molood Arman, Clément Bonnafous May 7 058 RVPO: Risk-Sensitive Alignment via Variance Regularization arXiv Paper Ivan Montero, Tomasz Jurczyk et al. May 7 059 Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents arXiv Paper Ziming Li, Jiatan Huang et al. May 7 060 CANDI: Contextual Alignment for Niche Domains Question Answering arXiv Paper Megha Chakraborty, Darssan Eswaramoorthi et al. May 6