Library

Subject
Tags

Oversight

#
001LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction RecognitionarXivPaperJiajun Cheng, Subarna Tripathi et al.Jul 22
002Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All ApproacharXivPaperLichao Mou, Shilan Zhang et al.Jul 17
003Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report KnowledgearXivPaperGuoliang You, Hongming Li et al.Jul 12
004SHTA: Semantic Hard Token Correction and Center Alignment for Semi-Supervised Medical Image SegmentationarXivPaperZhuo Zhang, Yiheng Zhong et al.Jul 8
005TACoS: Weakly Supervised Learning of Two-Dimensional Materials from Scribble Annotations to Precise SegmentationarXivPaperJiabei Chen, Liping Zhang et al.Jul 8
006ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable DynamicsarXivPaperZanwei Zhou, Jiazhong Cen et al.Jul 4
007Beyond Confidence in AI-Assisted Colonoscopy: A Spatial, Temporal and Quality-Aware Audit Framework for Endoscopic AI ReviewarXivPaperRoberto Alcaraz Machado, Ana Lucía Rodríguez BlancoJul 1
008CoPersona: Collaborative Persona Graphs for Robust LLM PersonalizationarXivPaperYangtian Zhang, Leyao Wang et al.Jul 1
009Emergence of Preferential Attachment and Glass-Ceiling Effects in Autonomous Networks of LLMsarXivPaperYiming Zhang, Vikram KrishnamurthyJul 1
010GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process SupervisionarXivPaperDi Wang, Peirong Zhang et al.Jul 1
011Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup TransferarXivPaperB. Wei, Xianhui Lin et al.Jun 30
012Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination MitigationarXivPaperXin Zou, Hao Deng et al.Jun 29
013Progressive Pixel-Neighborhood Deformable Cross-Attention for Multispectral Object DetectionarXivPaperTian Qiu, Jifeng Shen et al.Jun 23
014FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic PrecisionarXivPaperShiyao Wang, Xijuan Zeng et al.Jun 12
015Benchmarking stereo reconstruction for 3D printable Martian terrain modelsarXivPaperJoseph WangJun 9
016The Consistency Illusion: How Multi-Agent Debate Hides Reasoning MisalignmentarXivPaperXiaoyang Wang, Christopher C. YangJun 7
017Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy LearningarXivPaperZiyang Yao, Haochen Liu et al.Jun 4
018How is Latin America engaging with responsible metrics? A systematic review comparing regional and global scientific productionarXivPaperDaniela Oyarz'un-Cristi, 'Alvaro Cabezas-Clavijo et al.Jun 1
019Lattice Aggregation in Distributed Verification under Crash and Byzantine FailuresarXivPaperGilde Valeria Rodríguez, B. Bonakdarpour et al.Jun 1
020Mind Companion: An Embodied Conversational Agent for Process-Based PsychotherapyarXivPaperSofie Kamber, Lukas Diebold et al.Jun 1
021Multi-LLM Systems Exhibit Robust Semantic CollapsearXivPaperWeiyi Kong, Shiyang Lai et al.May 16
022WOW-Seg: A Word-free Open World Segmentation ModelarXivPaperDanyang Li, Tianhao Wu et al.May 16
023Towards Continuous Sign Language Conversation from Isolated SignsarXivPaperYoung Min Kim, K. Choo et al.May 14
024Pareto-Guided Optimal Transport for Multi-Reward AlignmentarXivPaperYing Ba, Tianyu Zhang et al.May 13
025HSUGA: LLM-Enhanced Recommendation with Hierarchical Semantic Understanding and Group-Aware AlignmentarXivPaperGuorui Li, Dugang Liu et al.May 12
026Filtering Memorization from Parameter-Space in Diffusion ModelsarXivPaperYu Zhe, Jiayan Yang et al.May 11
027Alignment as JurisprudencearXivPaperNicholas CaputoMay 8
028Change My View? The Dynamics of Persuasion and Polarization in Online DiscoursearXivPaperD. Freeborn, M. Alikani et al.May 8
029Implicit Preference Alignment for Human Image AnimationarXivPaperYuanzhi Wang, Xuhua Ren et al.May 8
030The Endogeneity of Miscalibration: Impossibility and Escape in Scored ReportingarXivPaperLauri Lov'en, Sasu TarkomaMay 8
031A Testable Certificate for Constant Collapse in Teacher-Guided VAEsarXivPaperZegu Zhang, Jian Peng et al.May 7
032Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion ModelsarXivPaperZhikai Li, Yue Zhao et al.May 7
033Automated alignment is harder than you thinkarXivPaperAleksandr Bowkis, Marie Davidsen Buhl et al.May 7
034Behavior Cue Reasoning: Monitorable Reasoning Improves Efficiency and Safety through OversightarXivPaperChristopher Z. Cui, Taylor W. Killian et al.May 7
035G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event DiagnosisarXivPaperXingyu Xiao, Mao Du et al.May 7
036I'm Sorry, but I Can't Help with Braille: Revealing Accessibility Failures in State-of-the-Art LLMsarXivPaperAbdullah Nazhat AbdullahMay 7
037Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMsarXivPaperA. Liu, Michael Zhang et al.May 7
038Misrouter: Exploiting Routing Mechanisms for Input-Only Attacks on Mixture-of-Experts LLMsarXivPaperZekun Fei, Zihao Wang et al.May 6
039Towards General Preference Alignment: Diffusion Models at Nash EquilibriumarXivPaperJiaming Hu, Jiamu Bai et al.May 6
040Explaining and Preventing Alignment Collapse in Iterative RLHFarXivPaperEtienne Gauthier, Francis Bach et al.May 5
041Bolek: A Multimodal Language Model for Molecular ReasoningarXivPaperFrederic Grabowski, Jacek Szczerbi'nski et al.May 4
042Combining Trained Models in Reinforcement LearningarXivPaperUjjwal Patil, Javad GhofraniMay 4
043Gradient-Gated DPO: Stabilizing Preference Optimization in Language ModelsarXivPaperInoussa MouicheMay 4
044Verifiable Counterfactual Supervision for Process Reward ModelsarXivPaperYinghui Chi, Lu WangMay 4
04512 Angry AI Agents: Evaluating Multi-Agent LLM Decision-Making Through Cinematic Jury DeliberationarXivPaperA. ErsozMay 3
046RMGAP: Benchmarking the Generalization of Reward Models across Diverse PreferencesarXivPaperYangyang Zhou, Yicao LiMay 3
047Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein DistancearXivPaperMuyang Li, Yuchen Liu et al.May 2
048Common-agency Games for Multi-Objective Test-Time AlignmentarXivPaperBaiting Chen, Tong Zhu et al.May 1
049Evaluating the Temporal Detection Capability of Integrated Gradients Applied on Sound ClassifierarXivPaperMartynas Dumpis, Tuomas VirtanenMay 1
050PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMsarXivPaperRavi Ranjan, Utkarsh Grover et al.May 1
051StepAudio 2.5 Technical ReportarXivPaperBin Lin, Bo Zhao et al.May 1
052Estimating LLM Grading Ability and Response Difficulty in Automatic Short Answer Grading via Item Response TheoryarXivPaperLongwei Cong, Sonja Hahn et al.Apr 30
053Learning from Disagreement: Clinician Overrides as Implicit Preference Signals for Clinical AI in Value-Based CarearXivPaperPrabhjot Singh, Abhishek Gupta et al.Apr 30
054Mapping how LLMs debate societal issues when shadowing human personality traits, sociodemographics and social media behaviorarXivPaperAlì Aghazadeh Ardebili, M. StellaApr 30
055Uncertainty-Aware Reward Discounting for Mitigating Reward HackingarXivPaperD. SinghaApr 29
056BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric DebatearXivPaperA.J. Mazza, Elad LeviApr 28
057Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance PerspectivearXivPaperHamid Osooli, Kareema Batool et al.Apr 28
058EvoSelect: Data-Efficient LLM Evolution for Targeted Task AdaptationarXivPaperTing-Wei Li, Sirui Chen et al.Apr 28
059LongSumEval: Question-Answering Based Evaluation and Feedback-Driven Refinement for Long Document SummarizationarXivPaperHuyen Nguyen, Haoxuan Zhang et al.Apr 28
060Dual-Track CoT: Budget-Aware Stepwise Guidance for Small LMsarXivPaperSagnik Chatterjee, Atharva Patil et al.Apr 27

Showing 60 of 2,476 documents · scroll for more