报告概述
本报告聚焦于AI agents(特别是AI科学家)在生物学领域的能力与风险。它系统介绍了agentic evaluations这一评估方法,用于衡量AI agent在复杂多步生物学任务中的表现,并强调了设计选择对结果解读的关键影响。报告基于作者团队的实际评估经验,提供了从定义、设计、运行到评分与文档化的实用考量,旨在帮助政策制定者、资助者和生物安全专家更严谨地理解评估证据。
报告的核心结论
AI agents加速生物学研究的同时引入新型生物安全风险。
报告指出,AI agents能够自主执行多步生物学工作流,如文献检索、序列设计、工具交互等,可能降低恶意行为者实施生物武器攻击的门槛。这种能力不仅体现在知识层面,还体现在实际执行上,从而增加了设计和释放生物武器的可能性。
Agentic evaluations比静态基准更能反映实际风险。
与传统的知识问答基准不同,agentic evaluations测试AI agent在规划、工具使用和适应性等方面的综合能力,更贴近真实科研流程。报告认为,静态基准可能遗漏关键风险点,而agentic evaluation能揭示能力在何处断裂以及如何与人类专业知识交互。
人类-代理交互模式显著影响评估结果。
报告强调,大多数评估忽略了人类参与的影响。例如,GPT-4在有人类辅助时性能从0%提升至86%。因此,评估时必须明确交互模式(如独立、协作或监督),否则结果可能被误读。不同模式下的能力结论不可直接迁移。
任务分解和渐进式辅助是揭示能力边界的关键。
生物学工作流包含多个依赖环节,端到端评分容易掩盖瓶颈。报告建议将任务分解为子任务,并在必要时提供渐进式帮助(如提示),以便观察下游能力。这种设计能更精确地定位弱点,避免因早期错误而低估整体潜力。
报告回答的关键问题
AI agent如何增加生物武器风险?
AI agents通过加速生物武器风险链的多个阶段(如构思、设计、测试、武器化)来增加风险。报告引用证据表明,LLM和AI agent已能在非专家水平下完成双用途生物学任务,且随着自主性提升,恶意行为者可能利用这些系统降低所需专业知识门槛。
Agentic evaluation与传统基准有何不同?
传统基准(如多选题)仅测试知识回忆,而agentic evaluation模拟真实科研流程,要求AI agent完成规划、工具调用、迭代调整等多步任务。报告认为,后者更能捕捉实际风险,因为风险往往源于多步整合而非孤立知识点。
如何设计可靠的生物agentic evaluation?
设计需明确动作空间、人类-代理交互模式、资源假设和专家水平。报告建议跨学科团队协作,将工作流分解为可评分子任务,选择合适的工具和渐进式辅助框架,并采用鲁棒评分方法(如规则脚本和LLM自动评分器结合)。透明文档同样关键。
人类在AI agent评估中扮演什么角色?
人类参与程度会根本改变评估结果。报告指出,即使有限的人类干预(如提供指导或纠正错误)也能显著提升AI agent性能。因此,评估必须明确描述人类角色的级别和领域,否则无法区分是agent能力还是人类辅助贡献。
报告中的代表性数据
GPT-4在人类辅助下的性能提升
2024,在具有挑战性的编程问题上,GPT-4在无人类干预时成功率为0%,但引入人类反馈后提升至86%以上(来源:Shi and Tang et al.,2024)。该数据用于说明人类-代理交互模式对评估结果的重大影响。
GPT-oss-120B在GPQA上跨提供商的表现差异
2025,同一模型GPT-oss-120B在不同推理提供商上运行GPQA基准时,性能差异超过8个百分点(来源:Artificial Analysis,2025)。这表明运行时的配置选择可能被误认为模型固有能力的差异。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- AI科学家发展现状:介绍2025年涌现的多个AI科学家系统(如Google的AI co-scientist、FutureHouse的Robin和Kosmos),并概述其能力边界。
- 生物武器风险链分析:基于Brady & Lee et al.(2026)的模型,详细分解从意图、构思到释放的各阶段,并评估AI agent在每个阶段的潜在赋能作用。
- 静态基准与agentic evaluation对比:评估现有生物安全基准(如GPQA、WMDP)的局限性,论证agentic evaluation在预测实际风险方面的优势。
- 跨学科团队组建建议:强调评估需整合生物学、机器学习工程和生物安全三方面专家,并提供组建和协作的实践指导。
- 动作空间与能力定义方法:教读者如何界定评估覆盖的动作空间,区分局部能力与路径完整能力,并避免过度泛化。
- 人类-代理交互模型分类:提出互动模式(如咨询、协作、自主)的分类法,并讨论每种模式对评估设计和结果解读的影响。
- 任务分解与工具选择:展示如何将复杂工作流(如生物工具使用)拆解为可测量子任务,并给出工具和环境选择的决策树。
- 评分与自动评分器使用:介绍多标准评分表、LLM自动评分器的开发与验证方法,包括使用合成示例和多人评判提高可靠性。
- 文档化与信息危害管理:提供评估条件披露的模板,同时讨论在生物安全领域如何平衡透明度和信息风险(如使用受控访问)。
- 出口管制对评估的影响:分析美国出口管制法规如何限制评估中的国际合作与信息共享,并提出政策改进建议。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





