001 SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments arXiv Paper Suryanarayana Reddy Yarrabothula, Manisha Chawla et al. Jul 6 002 Child Safety in Generative AI: An Expert-Guided and Incident-Grounded Evaluation Framework arXiv Paper Haein Kong Jul 1 003 REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs arXiv Paper Yifei Zhao, Qian Lou et al. Jun 22 004 Agentic Relationship Harm: Benchmarking and Gating Relational Manipulation in AI Agents arXiv Paper Pei-Sze Tan, Tasuku Igarashi et al. Jun 1 005 SafeVLA-Bench: A Benchmark for the Success-Safety Gap in Vision-Language-Action Models arXiv Paper Jialiang Fan, Weizhe Xu et al. May 30 006 HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation arXiv Paper Haoyu Wang, Zitong Li May 19 007 SafeManip: A Property-Driven Benchmark for Temporal Safety Evaluation in Robotic Manipulation arXiv Paper Chengyue Huang, Khang Huynh et al. May 12 008 MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks arXiv Paper Xinkai Zhang, Zhipeng Wei et al. May 10 009 OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents arXiv Paper Xinyu Li, Ronghui Mu et al. May 9 010 GLiGuard: Schema-Conditioned Classification for LLM Safeguard arXiv Paper Urchade Zaratiana, Mary Newhauser et al. May 8 011 XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity arXiv Paper Dasol Choi, Eugenia Kim et al. May 7 012 SoK: Robustness in Large Language Models against Jailbreak Attacks arXiv Paper Fei Xu, Hongsheng Hu et al. May 6 013 The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models arXiv Paper Alifia Hasan, Sumon Biswas May 6 014 Enhancing Agent Safety Judgment: Controlled Benchmark Rewriting and Analogical Reasoning for Deceptive Out-of-Distribution Scenarios arXiv Paper Zuoyu Zhang, Yanchen Zhu May 5 015 A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts arXiv Paper R. Young, Gregory Moody May 4 016 ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming arXiv Paper Mario Rodríguez Béjar, Francisco J. Cort'es-Delgado et al. May 4 017 MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety arXiv Paper Jialin Song, Xiaodong Liu et al. May 3 018 Multilingual Safety Alignment via Self-Distillation arXiv Paper Ruiyang Qin, Qingzhuo Wang et al. May 3 019 FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios arXiv Paper Yutao Hou, Yi Jiang et al. May 1 020 Modeling Implicit Conflict Monitoring Mechanisms against Stereotypes in LLMs arXiv Paper Jingshen Zhang, Bo Wang et al. May 1 021 Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification arXiv Paper C. C. Weng, Dingwen Li et al. May 1 022 SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking arXiv Paper Jindong Li, Ying Liu et al. May 1 023 Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory Balance arXiv Paper Minchan Kwon, Sunghyun Baek et al. May 1 024 FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption arXiv Paper Yanting Wang, Chenlong Yin et al. Apr 30 025 Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models arXiv Paper Shubham Kumar, Narendra Ahuja Apr 30 026 Benchmarking the Safety of Large Language Models for Robotic Health Attendant Control arXiv Paper M. Nakao, Kazuhiro Takemoto Apr 29 027 Cross-Lingual Jailbreak Detection via Semantic Codebooks arXiv Paper Shirin Alanova, B. Minko et al. Apr 28 028 Green Shielding: A User-Centric Approach Towards Trustworthy AI arXiv Paper Aaron J. Li, Nicola Sanchez et al. Apr 27 029 Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains arXiv Paper Emaan Bilal Khan, Amy Winecoff et al. Apr 27 030 Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms arXiv Paper Qi Li, Bo Yin et al. Apr 26 031 CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning arXiv Paper Shuxu Chen, Yitian Zhou et al. Apr 25 032 Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards arXiv Paper Taha Hammadia, Lucas Rea et al. Apr 25 033 Estimating Tail Risks in Language Model Output Distributions arXiv Paper Rico Angell, Raghav Singhal et al. Apr 24 034 SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs arXiv Paper Sihang Zhao, Kangrui Yu et al. Apr 24 035 HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative Writing arXiv Paper Euntaek Kim, Soomin Han et al. Apr 21 036 STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming arXiv Paper M. Jung, Y. Lim et al. Apr 21 037 SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models arXiv Paper Josue Torres-Fonseca, Naihao Deng et al. Apr 21 038 When Safety Fails Before the Answer: Benchmarking Harmful Behavior Detection in Reasoning Chains arXiv Paper Ishita Kakkar, Enze Zhang et al. Apr 21 039 ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System arXiv Paper Jiacheng Liang, Yaoyao Ma et al. Apr 20 040 Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks arXiv Paper Md Rysul Kabir, Zoran Tiganj Apr 20 041 Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF arXiv Paper Yuan Fang, Yiming Luo et al. Apr 20 042 HarmChip: Evaluating Hardware Security Centric LLM Safety via Jailbreak Benchmarking arXiv Paper Zeng Wang, Minghao Shao et al. Apr 18 043 A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models arXiv Paper Andrei-Marian Feier, V. Kocaman et al. Apr 15 044 AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance arXiv Paper A. A. Solanke Apr 14 045 Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors arXiv Paper Ruiping Yin, Tianxu Han et al. Apr 14 046 DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection arXiv Paper Ju Ren, Xingjian Pan et al. Apr 14 047 TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs arXiv Paper Qingchao Shen, Zibo Xiao et al. Apr 14 048 Ozone: A Unified Platform for Transportation Research arXiv Paper Ou Zheng, Ruyi Feng et al. Apr 13 049 AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models arXiv Paper Mintong Kang, Chenhao Fang et al. Apr 10 050 Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward arXiv Paper Weiyang Guo, Ze-Yun Shi et al. Apr 10 051 TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories arXiv Paper Yen-Shan Chen, Sian-Yao Huang et al. Apr 8 052 When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models arXiv Paper Ismail Hossain, Saiteja Puppala et al. Apr 8 053 Do No Harm: Exposing Hidden Vulnerabilities of LLMs via Persona-based Client Simulation Attack in Psychological Counseling arXiv Paper Qingyang Xu, Yaling Shen et al. Apr 6 054 AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents arXiv Paper Yunhao Feng, Yifan Ding et al. Apr 3 055 An Agentic Framework for Intent Co-Creation in 6G NaaS: Architecture and Open-Source Model Evaluation arXiv Paper Kostis Trantzas, Besiana Agko et al. Apr 1 056 Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models arXiv Paper Weidi Luo, Xiaofei Wen et al. Apr 1 057 SelfGrader: LLM Jailbreak Detection via Anchored Token-Level Logits arXiv Paper Zikai Zhang, Ruiyi Hu et al. Apr 1 058 Design Principles for the Construction of a Benchmark Evaluating Security Operation Capabilities of Multi-agent AI Systems arXiv Paper Yichen Cai, Mitchell John DeStefano et al. Mar 30 059 Squish and Release: Exposing Hidden Hallucinations by Making Them Surface as Safety Signals arXiv Paper Nathaniel Oh, P. Attie Mar 27 060 Prompt Attack Detection with LLM-as-a-Judge and Mixture-of-Models arXiv Paper Hieu Le, B. Goh et al. Mar 26