报告概述
本报告聚焦前沿大语言模型在生物学和化学领域的知识水平与安全拒答能力,由RAND旗下人工智能、安全与技术中心完成。研究覆盖截至2025年5月发布的39种主流开放权重与封闭权重模型,包括推理模型、常规模型及经过去安全微调和生物学增强微调的自定义模型。报告采用英国AI安全研究所的Inspect框架,统一实施六个公共知识基准和两个拒答基准,并将模型成绩与人类专家基线进行对比,其中为WMDP补充了探索性专家基线。报告旨在为政策制定者、模型开发者和第三方评估机构提供可参考的评估证据,帮助判断前沿AI系统在生物威胁场景下的潜在能力,并为改进基准设计、评估方法和报告规范提出建议。
报告的核心结论
前沿模型在生物学知识基准上已超越人类专家
截至2025年5月,以OpenAI o3、Claude 3.7 Sonnet Thinking等推理模型为代表的前沿LLM,在BioLP-bench、GPQA等生物学知识基准上达到或超过人类专家水平;几乎所有被测模型都超过了非专家在研究生级生物学问答中的表现,显示模型具备较强的专业生物知识储备。
多个公共生物学与化学基准接近饱和
报告发现,WMDP生物学子集在2024年底发布的新模型中得分已接近约85%的阈值,MMLU-Pro等基准也呈现趋平趋势。基准饱和使模型间得分差异变小,继续使用这些基准难以区分新一代模型的能力提升,可能误导对模型能力的判断。
去安全微调可降低拒答但损失知识成绩
通过低秩适配器对Llama 3.1 405B进行去安全微调后,HarmBench安全拒答率从100%降至2.4%,ALERT也从100%降至约43%(化学)和45%(生物);但该模型在多个知识基准上的准确率出现下滑,额外加入生物学数据的Biollama也未能完全恢复原有能力,说明去除安全护栏会带来附带能力损失。
人类基线是解释基准结果的关键
报告强调,缺少人类基线的基准难以判断模型实际风险水平。为此,RAND为WMDP补充了探索性专家基线,发现生物学专家的平均得分为60.5%、化学专家为43.3%,而许多模型已超过该水平,建议基准创建者广泛纳入并详细记录人类基线。
报告回答的关键问题
前沿大模型在生物学知识上超过人类专家了吗?
截至2025年5月,以o3和Claude 3.7 Sonnet Thinking为代表的推理模型已在BioLP-bench、GPQA等基准上达到或超过人类专家水平,在LAB-Bench的多个子集上也与博士级科学家持平或胜出。报告认为,这意味着前沿模型可能具备帮助生物研究人员解决复杂问题、甚至降低生物武器研发技术门槛的潜力。
移除安全限制的大模型会更危险吗?
报告通过微调构建了去除安全护栏的Unsafety Llama,发现其对有害请求的拒答率大幅下降,例如HarmBench上从100%降至2.4%。但这些模型在知识基准上的表现也同步下降,说明去安全微调并非毫无代价。报告指出,这类模型对现实生物风险的影响仍不明确,需要结合其他评估方法进一步研究。
当前生物学评估基准是否已经饱和?
报告发现,WMDP生物学子集可能已在约85%正确率处饱和,2024年3月之后发布的大多数前沿模型得分都在80%以上;MMLU-Pro等基准也呈现接近饱和的趋势。基准饱和意味着它们难以再区分新一代模型的能力提升,报告建议开发更具挑战性、部分私有化的新基准。
如何改进大模型生物学能力评估?
报告建议在基准中广泛加入人类基线并详细记录招募和测试方法;创建难度更高、更专业化的评估,并让部分数据集保持私有或半私有以防止训练数据污染;同时要求基准实施者统一报告超参数、提示词和评分器等实现细节,以提高不同评估之间的可比性和可复现性。
大模型能否被用于生物武器开发?
报告评估了模型对生物和化学武器相关知识的掌握程度,发现前沿模型在WMDP等专门基准上已超过非专家和部分领域专家,但它们在面对有害请求时通常具有较强的拒答能力。去除安全护栏的微调模型拒绝率下降,但知识成绩也受损;报告认为需要结合任务型评估、红队测试和人类uplift试验来判断真实风险。
报告中的代表性数据
评估模型总数
截至2025年5月,包括22个来自商业API提供商(OpenAI、Anthropic、Google DeepMind、Amazon、xAI)的模型和17个来自开放权重开发者的模型。
WMDP生物学专家基线平均正确率
报告研究期间,基于两位微生物学和生物化学博士回答242道随机抽样题目(约WMDP生物学子集的20%)的得分,分别为59.9%和61.1%,属于探索性结果。
HarmBench安全拒答率变化
2025年,对Llama 3.1 405B进行去安全微调后(Unsafety Llama),其在HarmBench化学/生物子集上的拒答率急剧下降,显示安全护栏可以被低成本移除。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 完整模型评估结果与可视化:包含39个模型在8个基准上的准确率热力图、安全拒答率热力图,以及生物学知识与拒答倾向的散点图,方便横向对比各模型能力与安全表现。
- 八大基准的详细说明:对BioLP-bench、LAB-Bench、WMDP、GPQA、MMLU、MMLU-Pro、HarmBench、ALERT逐一介绍题目类型、评估流程、示例题目、发布年份、人类基线情况以及各自的优缺点,帮助读者理解不同基准的适用边界。
- 模型与微调详情:附录列出全部模型的开发者、发布日期和知识截止日期,并说明Unsafety Llama和Biollama两种定制模型的低秩适配器训练方法、训练数据来源(实验室协议和PubMed Central论文)以及不对外发布的原因。
- WMDP人类专家基线补充:介绍RAND为WMDP生物学和化学子集开展的探索性专家基线实验,包括专家资质、题目抽样比例(20%)、测试时长(生物学专家5—6小时,化学专家0.9—1.6小时)和得分结果,并讨论局限性。
- 评估提示词与评分器完整模板:收录多项选择提示格式、BioLP-bench评估与评分提示、HarmBench模型评分器提示、ALERT使用的Llama Guard提示等,便于研究者复现实验。
- Inspect框架实现细节:说明如何利用英国AI安全研究所的开源Inspect框架统一执行基准,包括数据集加载、求解器设置、模型评分器选择、计算环境(AWS EC2)、OpenAI内容过滤器差异及统计误差计算方法。
- 三大挑战与解决方案:围绕基准缺少人类基线、与现实风险脱节、实现细节影响结果三个问题,提出增加人类基线、开发更困难和专用的基准、采用私有或半私有数据集、整合工具使用、使用互补基准套件以及透明报告实现细节等建议。
- 未来研究方向:报告将把基准测试作为更广泛评估体系的一部分,计划结合人类uplift试验、AI代理评估和专家红队测试,并探讨工具调用、多模态等对模型生物学能力的影响。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。
相关报告

Contemporary Foundation AI Models Increase Biological Weapons Risk

The Dynamics Behind Artificial Intelligence's Impact on Productivity Growth

Empowering Imperial County: A Comprehensive Workforce and Economic Development Strategy for Harnessing the Lithium Opportunity

Sustaining Strong Rural Partnerships and Interventions to Serve Student and Regional Workforce Development Needs

Manipulating Minds: Security Implications of AI-Induced Psychosis
