Library

Subject
Tags

18 matches · evaluations

#
001AI and Bomb Plots: Distinguishing Potential Effects from Language ModelsGovAIReportGovAIMar 1
002Measuring AI R&D AutomationGovAIReportT. Nikonova, O. Zharkevich et al.Mar 1
003Measuring Mid-2025 LLM-Assistance on Novice Performance in BiologyGovAIReportShenda Hong, Alexander Kleinman et al.Feb 1
004FMF Comment on NIST Outline of Draft TEVV StandardFMFReportFMFSep 12, 2025
005STREAM (ChemBio): A Standard for Transparently Reporting Evaluations in AI Model ReportsGovAIReportTegan McCaslin, Jide Alaga et al.Sep 1, 2025
006Forecasting LLM-Enabled Biorisk and the Efficacy of SafeguardsGovAIReportGovAIJul 1, 2025
007Frontier Capability AssessmentsFMFReportBoyi Wei, Benedikt Stroebl et al.Apr 22, 2025
008Preliminary Reporting Tiers for AI-Bio Safety EvaluationsFMFReportJ. OstromMar 18, 2025
009In-House Evaluation Is Not Enough: Towards Robust Third-Party Flaw Disclosure for General-Purpose AIGovAIReportShayne Longpre, Kevin Klyman et al.Mar 1, 2025
010Measuring AI Agent Autonomy: Towards a Scalable Approach with Code InspectionGovAIReportPeter Cihon, M. Stein et al.Feb 1, 2025
011Preliminary Taxonomy of AI-Bio Safety EvaluationsFMFReportMuhammad Ashraf, Muhammad Hazim et al.Dec 20, 2024
012Preliminary Taxonomy of Pre-Deployment Frontier AI Safety EvaluationsFMFReportMatteo Pistillo, Charlotte StixDec 20, 2024
013A Grading Rubric for AI Safety FrameworksGovAIReportJide Alaga, Jonas Schuett et al.Sep 1, 2024
014Early Best Practices for Frontier AI Safety EvaluationsFMFReportAidan Homewood, Sophie Williams et al.Jul 31, 2024
015What is Red Teaming?FMFReportFMFOct 24, 2023
016Structured Access for Third-Party Research on Frontier AI ModelsGovAIReportGovAIOct 1, 2023
017Coordinated Pausing: An Evaluation-Based Coordination Scheme for Frontier AI DevelopersGovAIReportJide Alaga, Jonas SchuettSep 1, 2023
018Model Evaluation for Extreme RisksGovAIReportToby Shevlane, Sebastian Farquhar et al.May 1, 2023

Showing 18 of 18 documents