001 Bowel Obstruction Detection and Localization on Abdominal CT with Deep Learning arXiv Paper Moritz Vandenhirtz, Andrea Agostini et al. 7 days ago 002 CARDIAG: A Dense Segment Classification Benchmark of Deep Learning Architectures for Coronary Angiography arXiv Paper Dominik Bernard Lau, Hubert Malinowski et al. 7 days ago 003 Class-Balanced Softmax: A Bayes Theory-Based Method for Long-Tailed Recognition arXiv Paper Yi-Hang Zhu, Rajeev Raman et al. 7 days ago 004 Correlation-Aware and Gaussianity-Preserving Robust Latent Angular Watermarking for Diffusion Models arXiv Paper Yebin Zheng, Haonan An et al. 7 days ago 005 Deep Convolutional Large-Margin $\ell_p$-SVDD for Visual Anomaly Detection arXiv Paper Alireza Dastmalchi Saei, Shervin Rahimzadeh Arashloo 7 days ago 006 Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions arXiv Paper Erik C. Rye, Robert Beverly 7 days ago 007 EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection arXiv Paper Hao Yang, Jin Wang et al. 7 days ago 008 Farmland Extent and Visible Boundary Mapping from 1 m NAIP Imagery Using Residual U-Net and Text-Prompted SAM 3 Refinement arXiv Paper Sreejeet Maity, Feng Zhu et al. 7 days ago 009 Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs arXiv Paper Yuheng Zong, Minghua Wang et al. 7 days ago 010 ISPCloak: Weaponizing ISP for Optimization-Free Physical Camouflage against Deepfake Detectors arXiv Paper Liangqin Ren, Zeyan Liu et al. 7 days ago 011 Rethinking Multi-Branch and Cross-Backbone Fusion for Vehicle Re-Identification in the Foundation-Model Era arXiv Paper Yu Wang, Hongyu Yang 7 days ago 012 SM4RT: Learning Structured Motion Geometry for 4D Reconstruction arXiv Paper Shing Ho J. Lin, Wenzhao Zheng et al. 7 days ago 013 Scaling Native Multimodal Pre-Training From Scratch arXiv Paper Haoyuan Wu, Aoqi Wu et al. 7 days ago 014 SceneActBench: Can Agents Act on the 3D Scenes They See? arXiv Paper Yifei Zhao, Xiangxin Zhou et al. 7 days ago 015 SiPhy: Single-Image Physical Property Reasoning arXiv Paper H. Lê, Joon-Byum Kwon et al. 7 days ago 016 Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation arXiv Paper Asif Ferdous 7 days ago 017 TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution arXiv Paper Sicheng Gao, Zhuyun Zhou et al. 7 days ago 018 TextSLIP: Text Self-Supervised CLIP for Medical Report Generation arXiv Paper Shashank Rao Marpally, Allan Wang et al. 7 days ago 019 Time-Reversed Imaging: A Multimodal Benchmark and Framework for Reconstructing Past Human-Environment Interactions arXiv Paper Jorge Bacca, Kebin Contreras et al. 7 days ago 020 Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability arXiv Paper Ahmed M. Abuzuraiq, Philippe Pasquier 7 days ago 021 Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning arXiv Paper Hao Yang, Jin Wang et al. 7 days ago 022 Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents arXiv Paper Suman Navaratnarajah, Taehyoung Kim et al. 7 days ago 023 dRAE: Representation Autoencoder with Hyper-Spherical Codes arXiv Paper Tianren Ma, Lin Long et al. 7 days ago 024 3D-Aware VLMs with Implicit and Explicit Geometries arXiv Paper Wenhao Li, Xueying Jiang et al. Jul 23 025 Adaptive Identity Anchoring: Closed-Loop Keyframe Placement for Synthetic Paired Supervision in Video Face Swapping arXiv Paper Logan Robbins Jul 23 026 CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA arXiv Paper Hanseok Oh, Parishad BehnamGhader et al. Jul 23 027 Counterfactual Explainability Framework With CycleGAN And Counterfactual-Classifier Alignnment Score for Retinal Disease Classification arXiv Paper Kritanu Chattopadhyay, Sayanjit Singha Roy et al. Jul 23 028 DART: A Degradation-Aware Recurrent Transformer for Archival Film Restoration arXiv Paper Mikołaj Jastrzębski, Wojciech Kozlowski et al. Jul 23 029 DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation arXiv Paper Sung-Hoon Yoon, Hoyong Kwon et al. Jul 23 030 ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing arXiv Paper Yueyi Liu, Chi Zhang et al. Jul 23 031 EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization arXiv Paper Lihuang Fang, Yuchen Zou et al. Jul 23 032 GS-Agent: Creating 4D Physical Worlds With Generative Simulation arXiv Paper Hongxin Zhang, Chunru Lin et al. Jul 23 033 GraphVid: Interactive Graph-Controllable Video Generation arXiv Paper Vedant r Shah, Onkar Susladkar et al. Jul 23 034 HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving arXiv Paper Quanfu Yu, Xian Wu et al. Jul 23 035 Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms arXiv Paper Xiao Zhu, S. Iyengar Jul 23 036 KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers arXiv Paper Yann Bouquet, Alireza Khodamoradi et al. Jul 23 037 M$^3$-Gen: Interpretable Multimodal Generation of Gene Expression Profiles Using Clinical and Imaging Data arXiv Paper Francesca Pia Panaccione, Carlo Sgaravatti et al. Jul 23 038 PC-Edit: Prompt-Contrastive Region Discovery and Region-Guided Editing arXiv Paper Jian Zhang, Zhijun Zhang Jul 23 039 Physiological Signals as a Forensic Modality for Talking-Face Deepfake Detection arXiv Paper Pablo Santiago Potes Velasco, María del Mar García Matabanchoy et al. Jul 23 040 Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images arXiv Paper Idris Karel Seunda Ekwe, Patrick Tenga Shako et al. Jul 23 041 SCALE: Self-Supervised Constraint-Aware Layout GEneration for Local P&R DRV Fixing at Advanced Nodes arXiv Paper Khai Nguyen, Yang Ni et al. Jul 23 042 Safety-oriented sidewalk and road segmentation for smartphone-based assistive navigation arXiv Paper Hakan Calim, Anamaria Dumitrescu et al. Jul 23 043 Self-Poisoning in Adaptive Out-of-Distribution Detection: A Sharp-Threshold Theory and Certified Label-Free Calibration arXiv Paper Ronak Bhalgami Jul 23 044 Sparse Concept Channels in Frozen 3D CT Vision Encoders arXiv Paper F. Nooralahzadeh, L. Bogensperger et al. Jul 23 045 Synthetic data generation framework for quality control automation in gravure printing arXiv Paper Korota Arsène Coulibaly, Mohamed Hamlich et al. Jul 23 046 Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning arXiv Paper L. Orsingher, Thomas De Min et al. Jul 23 047 Visual Contrastive Self-Distillation arXiv Paper Yijun Liang, Yunjie Tian et al. Jul 23 048 When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation arXiv Paper Dongbin Na Jul 23 049 A Systematic Benchmark of Intensity Normalisation Methods for 3D Knee MRI Segmentation and Cross-Domain Generalisability arXiv Paper Oliver Mills, Philip G. Conaghan et al. Jul 22 050 Analytic Distribution of Classifier-Free Guidance for Schedule Design arXiv Paper Enze Jiang, Zheng Ma Jul 22 051 Can an AI System Be Creative? A Critical Perspective from Art and Engineering arXiv Paper Ivan Magrin-Chagnolleau Jul 22 052 DS@GT ARC at ImageCLEFmed GANs 2026: Geometric Filtering for Privacy-Preserving CT Slice Generation arXiv Paper Eric Regina, Richard Arnaud et al. Jul 22 053 Detecting Neural Network Failures through Spectral Analysis of Internal Activations arXiv Paper Andy Song, Bolong Han et al. Jul 22 054 ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models arXiv Paper Karan Goyal, Afreen Hossain et al. Jul 22 055 G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection arXiv Paper Yechan Kim, Jonghyun Park et al. Jul 22 056 HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation arXiv Paper Jinliang Shen, Li Su et al. Jul 22 057 Masked Topology Modeling for Self-Supervised Learning on Parametric CAD arXiv Paper Heinrich Jiang, J. Jang Jul 22 058 Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos arXiv Paper Penglei Sun et al. Jul 22 059 OSVE: One Step Video Editing with One Step Diffusion Models arXiv Paper Habin Lim, Gyeong-Moon Park Jul 22 060 PRISM-DR: Per-lesion Retinal Inference with Specialist Models for Diabetic Retinopathy arXiv Paper Z. Özeren, Tansel Uyar Jul 22