Library

Subject
Tags

1,565 matches · Evaluations & benchmarks

#
001SteelBench: Evaluating Vision-Language Models in Real-World Industrial EnvironmentsarXivPaperSuryanarayana Reddy Yarrabothula, Manisha Chawla et al.Jul 6
002Child Safety in Generative AI: An Expert-Guided and Incident-Grounded Evaluation FrameworkarXivPaperHaein KongJul 1
003REALM: A Unified Red-Teaming Benchmark for Physical-World VLMsarXivPaperYifei Zhao, Qian Lou et al.Jun 22
004Agentic Relationship Harm: Benchmarking and Gating Relational Manipulation in AI AgentsarXivPaperPei-Sze Tan, Tasuku Igarashi et al.Jun 1
005SafeVLA-Bench: A Benchmark for the Success-Safety Gap in Vision-Language-Action ModelsarXivPaperJialiang Fan, Weizhe Xu et al.May 30
006HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph InterpretationarXivPaperHaoyu Wang, Zitong LiMay 19
007SafeManip: A Property-Driven Benchmark for Temporal Safety Evaluation in Robotic ManipulationarXivPaperChengyue Huang, Khang Huynh et al.May 12
008MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak AttacksarXivPaperXinkai Zhang, Zhipeng Wei et al.May 10
009OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM AgentsarXivPaperXinyu Li, Ronghui Mu et al.May 9
010GLiGuard: Schema-Conditioned Classification for LLM SafeguardarXivPaperUrchade Zaratiana, Mary Newhauser et al.May 8
011XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural SensitivityarXivPaperDasol Choi, Eugenia Kim et al.May 7
012SoK: Robustness in Large Language Models against Jailbreak AttacksarXivPaperFei Xu, Hongsheng Hu et al.May 6
013The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language ModelsarXivPaperAlifia Hasan, Sumon BiswasMay 6
014Enhancing Agent Safety Judgment: Controlled Benchmark Rewriting and Analogical Reasoning for Deceptive Out-of-Distribution ScenariosarXivPaperZuoyu Zhang, Yanchen ZhuMay 5
015A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled PromptsarXivPaperR. Young, Gregory MoodyMay 4
016ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational PrimingarXivPaperMario Rodríguez Béjar, Francisco J. Cort'es-Delgado et al.May 4
017MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM SafetyarXivPaperJialin Song, Xiaodong Liu et al.May 3
018Multilingual Safety Alignment via Self-DistillationarXivPaperRuiyang Qin, Qingzhuo Wang et al.May 3
019Comprehensive AI Governance Requires Addressing Non-Model Capability GainsGovAIReportArthur Goemans, D. Altman et al.May 1
020FinSafetyBench: Evaluating LLM Safety in Real-World Financial ScenariosarXivPaperYutao Hou, Yi Jiang et al.May 1
021Modeling Implicit Conflict Monitoring Mechanisms against Stereotypes in LLMsarXivPaperJingshen Zhang, Bo Wang et al.May 1
022Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety ClassificationarXivPaperC. C. Weng, Dingwen Li et al.May 1
023SRTJ: Self-Evolving Rule-Driven Training-Free LLM JailbreakingarXivPaperJindong Li, Ying Liu et al.May 1
024Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory BalancearXivPaperMinchan Kwon, Sunghyun Baek et al.May 1
025FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge CorruptionarXivPaperYanting Wang, Chenlong Yin et al.Apr 30
026Minimal, Local, Causal Explanations for Jailbreak Success in Large Language ModelsarXivPaperShubham Kumar, Narendra AhujaApr 30
027Benchmarking the Safety of Large Language Models for Robotic Health Attendant ControlarXivPaperM. Nakao, Kazuhiro TakemotoApr 29
028Cross-Lingual Jailbreak Detection via Semantic CodebooksarXivPaperShirin Alanova, B. Minko et al.Apr 28
029Green Shielding: A User-Centric Approach Towards Trustworthy AIarXivPaperAaron J. Li, Nicola Sanchez et al.Apr 27
030Safety Drift After Fine-Tuning: Evidence from High-Stakes DomainsarXivPaperEmaan Bilal Khan, Amy Winecoff et al.Apr 27
031Vision-Language-Action Safety: Threats, Challenges, Evaluations, and MechanismsarXivPaperQi Li, Bo Yin et al.Apr 26
032CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM ReasoningarXivPaperShuxu Chen, Yitian Zhou et al.Apr 25
033Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC StandardsarXivPaperTaha Hammadia, Lucas Rea et al.Apr 25
034Estimating Tail Risks in Language Model Output DistributionsarXivPaperRico Angell, Raghav Singhal et al.Apr 24
035SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMsarXivPaperSihang Zhao, Kangrui Yu et al.Apr 24
036HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative WritingarXivPaperEuntaek Kim, Soomin Han et al.Apr 21
037STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red TeamingarXivPaperM. Jung, Y. Lim et al.Apr 21
038SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language ModelsarXivPaperJosue Torres-Fonseca, Naihao Deng et al.Apr 21
039When Safety Fails Before the Answer: Benchmarking Harmful Behavior Detection in Reasoning ChainsarXivPaperIshita Kakkar, Enze Zhang et al.Apr 21
040ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward SystemarXivPaperJiacheng Liang, Yaoyao Ma et al.Apr 20
041Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM JailbreaksarXivPaperMd Rysul Kabir, Zoran TiganjApr 20
042Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIFarXivPaperYuan Fang, Yiming Luo et al.Apr 20
043HarmChip: Evaluating Hardware Security Centric LLM Safety via Jailbreak BenchmarkingarXivPaperZeng Wang, Minghao Shao et al.Apr 18
044A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language ModelsarXivPaperAndrei-Marian Feier, V. Kocaman et al.Apr 15
045AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark GovernancearXivPaperA. A. SolankeApr 14
046Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy BackdoorsarXivPaperRuiping Yin, Tianxu Han et al.Apr 14
047DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt InjectionarXivPaperJu Ren, Xingjian Pan et al.Apr 14
048TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMsarXivPaperQingchao Shen, Zibo Xiao et al.Apr 14
049Ozone: A Unified Platform for Transportation ResearcharXivPaperOu Zheng, Ruyi Feng et al.Apr 13
050AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat ModelsarXivPaperMintong Kang, Chenhao Fang et al.Apr 10
051Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable RewardarXivPaperWeiyang Guo, Ze-Yun Shi et al.Apr 10
052TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling TrajectoriesarXivPaperYen-Shan Chen, Sian-Yao Huang et al.Apr 8
053When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard ModelsarXivPaperIsmail Hossain, Saiteja Puppala et al.Apr 8
054Do No Harm: Exposing Hidden Vulnerabilities of LLMs via Persona-based Client Simulation Attack in Psychological CounselingarXivPaperQingyang Xu, Yaling Shen et al.Apr 6
055AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use AgentsarXivPaperYunhao Feng, Yifan Ding et al.Apr 3
056An Agentic Framework for Intent Co-Creation in 6G NaaS: Architecture and Open-Source Model EvaluationarXivPaperKostis Trantzas, Besiana Agko et al.Apr 1
057Artificial Intelligence Index Report 2026Stanford HAIReportÁlvaro Soto, R. Durán et al.Apr 1
058Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language ModelsarXivPaperWeidi Luo, Xiaofei Wen et al.Apr 1
059SelfGrader: LLM Jailbreak Detection via Anchored Token-Level LogitsarXivPaperZikai Zhang, Ruiyi Hu et al.Apr 1
060Design Principles for the Construction of a Benchmark Evaluating Security Operation Capabilities of Multi-agent AI SystemsarXivPaperYichen Cai, Mitchell John DeStefano et al.Mar 30

Showing 60 of 1,565 documents · scroll for more