Library

Subject
Tags

200,223 matches · cs.CV

#
001ARD-REFSM: Enhancing Reflection Symmetry Detection with Asymmetric Denoising and Rotation EquivariancearXivPaperDongfu Yin et al.Yesterday
002Beyond Classification: Pathology Foundation Models as Detection Encoders for Mitotic FiguresarXivPaperSweta Banerjee et al.Yesterday
003Cross-Embodiment Transfer via Behavior-Aligned RepresentationsarXivPaperAjay Sridhar et al.Yesterday
004DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure EnhancementarXivPaperShubin Ma et al.Yesterday
005DS@GT ARC at ImageCLEFmedical 2026: Architectural Diversity for Concept Detection and Foundation-Model Scaling for Caption Prediction in Medical Image AnalysisarXivPaperBowen Wang et al.Yesterday
006Drawing-Recode: Annotation Grounding for Parametric CAD Code Generation from Raster 2D CAD DrawingsarXivPaperMingi Kim et al.Yesterday
007EEG-EditBench: Probing Visual Information in EEG-Image Retrieval Models with Controlled Image EditsarXivPaperKaifan Zhang et al.Yesterday
008EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPEarXivPaperZexuan Yan et al.Yesterday
009FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion InferencearXivPaperHanshuai Cui et al.Yesterday
010Filling the Pareto-Optimal Front for Affordance Segmentation on Embedded Devices Using RGB-D CamerasarXivPaperEdoardo Ragusa et al.Yesterday
011GVR-Coder: A Visual-Feedback Framework for Structured SVG Generation in Complex Document and Meeting ScenariosarXivPaperYiming Xu et al.Yesterday
012JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw PuzzlesarXivPaperShawn Li et al.Yesterday
013Kohn-Sham Spectral Embedding on Sparse Graphs at the Nishimori Temperature for Image ClassificationarXivPaperV. S. Usatyuk et al.Yesterday
014LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM InferencearXivPaperFeng Yang et al.Yesterday
015Learning Color Grading, No Photo Sharing: Federated Aesthetic Preference Learning for Personalized Image EnhancementarXivPaperChuanzhi Xu et al.Yesterday
016MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form VideosarXivPaperJinpeng Hu et al.Yesterday
017MUL-T: Decoding Spatial Cellular Architecture in Multiplexed Tissue ImagesarXivPaperFarzaneh Seyedshahi et al.Yesterday
018MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision TransformersarXivPaperMd. Mehrab Hossain Opi et al.Yesterday
019MonoVoc: Decoupling Geometry and Semantics for Lightweight Monocular Open-Vocabulary 3D GaussiansarXivPaperPouya Ardekhani et al.Yesterday
020Negative controls reveal volume-driven confounding in radiomics and imaging foundation model featuresarXivPaperKaty L. Scott et al.Yesterday
021ODEWorld: A Continuous Predictive Architecture via Physical-Time FlowarXivPaperDongxiu Liu et al.Yesterday
022OPLD: On-Policy Latent Distillation for Multimodal ReasoningarXivPaperShoutai Zhu et al.Yesterday
023OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward ModelsarXivPaperQiushi Sun et al.Yesterday
024ObjectStream: Latent Objects as Memory Anchors for Streaming Video UnderstandingarXivPaperMingkang Dong et al.Yesterday
025Private Face Recognition Training Dataset Publication via Identity-Decoupled and Geometry-Preserving Face DistillationarXivPaperShuhuan Chen et al.Yesterday
026QQWorld: Quantile-Quantile Matching for World Model RegularizationarXivPaperZhoushun Yu et al.Yesterday
027Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI AgentsarXivPaperHanzhang Zhou et al.Yesterday
028ReToken: One Token to Improve Vision-Language Models for Visual RetrievalarXivPaperYao Xiao et al.Yesterday
029RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG GenerationarXivPaperShaobo Liu et al.Yesterday
030SAFViT: Spatial Attention Fusion Gating for Vision Transformer-Based Nucleus Segmentation and ClassificationarXivPaperHarshit Mittal et al.Yesterday
031ScaFE: Data-Efficient Scar Classification with LLM-Generated Clinical Feature ProgramsarXivPaperRuman Wang et al.Yesterday
032ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its ShadowarXivPaperJin Cao et al.Yesterday
033Sign Language Question Answering: A New Task, Benchmark, and Baseline for Sign Language UnderstandingarXivPaperShiwei Gan et al.Yesterday
034Simplifying Neural Networks During TrainingarXivPaperLorenzo Sciandra et al.Yesterday
035Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free DistillationarXivPaperSimone Giano et al.Yesterday
036Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data AugmentationarXivPaperAntonio Delgado-Rosa et al.Yesterday
037Towards Practical Algorithm Selection for Unsupervised Domain Adaptation in Medical ImagingarXivPaperYiheng Xiong et al.Yesterday
038Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3arXivPaperJens Lehmann et al.Yesterday
039Understanding Submodular Information Measure Based Objectives for Representation Learning: A Variance and Separation PerspectivearXivPaperRishabh Iyer et al.Yesterday
040VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy DistillationarXivPaperKangning Zhang et al.Yesterday
041What Makes Deep Learning Work for Traditional Chinese Medicine Tongue Diagnosis? A Comprehensive Ablation StudyarXivPaperLongxia Gao et al.Yesterday
042What to Remove, What to Preserve: Dual-Ambiguity Rectification for All-in-One Image RestorationarXivPaperCencen Liu et al.Yesterday
043Anatomy Contextualized Adaption of CT Foundation ModelsarXivPaperRoshan Kenia et al.2 days ago
044BATS: Resource-Efficient Volumetric Segmentation with Boundary-Aware Mixed-Resolution TokensarXivPaperDavid Hagerman et al.2 days ago
045CG-World: A Large-Scale World-State Dataset and Protocol for World ModelsarXivPaperYiming Cai et al.2 days ago
046Classification of Disease from Lungs X-ray Images using VGG16, VGG19 and ResNet50 ModelsarXivPaperNand Lal Yadav et al.2 days ago
047DLAM: Distributional Latent Actions with Temporal ConstraintsarXivPaperZuojin Tang et al.2 days ago
048Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer SubstitutionarXivPaperMingkuan Feng et al.2 days ago
049Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise PerspectivesarXivPaperXiaolong Liu et al.2 days ago
050Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End GenerationarXivPaperAlexi Gladstone et al.2 days ago
051FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-SpoofingarXivPaperHongyang Wang et al.2 days ago
052FPSGen: Flexible Point Cloud Scene Generation with BEV-Supported Transport FlowsarXivPaperWenzhe He et al.2 days ago
053FakeIDet3-DB: Refining Digital Attacks and Patch Extraction for Secure ID BenchmarkingarXivPaperMuñoz-Haro Javier et al.2 days ago
054Hearsay: Vision-Language Medical Diagnoses Without an ImagearXivPaperSiddharth Vohra2 days ago
055InkShield: Writing Style Protection Against Unauthorized Handwriting MimicryarXivPaperJian Xiong et al.2 days ago
056Lottery Tickets Are Not Deployment TicketsarXivPaperBum Jun Kim2 days ago
057Mitigating Compounding Error via Video Representation RegularizationarXivPaperTaiye Chen et al.2 days ago
058Multimodal fusion of visual and morphometric features for avian bone classificationarXivPaperNevio Dubbini et al.2 days ago
059Online Handwriting Trajectory Reconstruction from Kinematic Sensors using Temporal Convolutional NetworkarXivPaperWassim Swaileh et al.2 days ago
060Physically Real-time Infrared Attack against Optical Flow Estimation NetworksarXivPaperShen You et al.2 days ago

Showing 60 of 200,223 documents · scroll for more