报告概述
报告聚焦于评估大型语言模型(LLM)代理在数字到物理过渡中的能力,以DNA获取作为生物武器风险链的关键瓶颈。研究测试了来自OpenAI、Anthropic和Google的8个前沿模型,在ReAct代理框架下执行台式DNA合成任务。任务要求代理设计DNA寡核苷酸、与模拟合成器交互并生成实验室方案。评分采用分段标准,包括序列正确性、PCA所需的反向互补、限制性酶切位点和终止密码子。报告还包含一项物理验证,证明o3代理设计的序列可成功表达功能性蛋白。
报告的核心结论
最新一代模型可靠设计满足所有评分标准的DNA序列。
GPT-5、Claude Opus 4.5和Gemini 3 Pro在eGFP任务中均以9/10或10/10的成功率设计出符合所有评分标准的DNA片段,包括正确的序列编码、反向互补交替、限制性酶切位点和终止密码子。这标志着与前代模型相比的显著突破,前代模型普遍未能完成反向互补步骤。
o3驱动的代理设计出在实验室中成功表达功能性蛋白的DNA序列。
在物理验证中,o3代理设计的eGFP DNA片段经台式合成仪合成后,按照其生成的实验室方案进行组装、克隆和表达,成功产生荧光蛋白。这证明LLM代理可以设计生物学上连贯的序列,并通过数字接口指导实际实验操作,实现数字到物理的转化。
所有前沿模型在部分尝试中能与模拟合成器交互并设计生物学上合理的DNA片段。
即使早期模型普遍未能正确反向互补,它们仍能在多数尝试中提交有效API调用、编码正确序列并添加限制性酶切位点。代理性能存在脆弱性,如幻觉和自信失误,但整体表现出对分子生物学任务的基本理解能力。
多个前沿模型拒绝协助DNA合成任务。
o3、Claude Opus 4、GPT-5和Opus 4.5拒绝了所有或部分关于流感HA序列的请求,Claude Opus 4还拒绝了约一半的eGFP请求。然而,这些拒绝并非统一,且本项目未尝试越狱,因此其作为保护措施的有效性不应过度解读。
报告回答的关键问题
LLM agents能否自主设计DNA序列用于台式合成?
能。测试中,GPT-5、Claude Opus 4.5和Gemini 3 Pro可自主设计满足所有评分标准的DNA片段,包括正确的序列、反向互补交替和限制性酶切位点。更早期的模型虽未完成反向互补,但也能设计生物学上合理的片段。物理验证进一步证明o3设计的序列可在实验室中成功表达蛋白。
前沿模型在生物安全评估中的表现如何?
最新一代模型(GPT-5、Opus 4.5、Gemini 3 Pro)在eGFP任务中几乎完美表现,但多个模型对流感HA任务表现出高拒绝率。性能存在脆性,常见失败包括幻觉、工具使用错误和概念遗漏(如反向互补)。物理验证确认了数字设计到物理产品的可行性,但距离完整病原体制造仍有多个步骤。
AI如何影响生物武器风险链中的DNA获取瓶颈?
报告指出,台式DNA合成是生物武器风险链中设计到构建步骤的关键瓶颈。LLM代理可大幅降低非专业人员在DNA序列设计、合成订单提交和实验室方案制定方面的技术门槛。测试表明,前沿模型已能自主完成数字设计步骤,但物理合成、组装和克隆仍需人类操作。
哪些模型在DNA合成任务中表现最佳?
GPT-5、Claude Opus 4.5和Gemini 3 Pro在eGFP任务中均以极高性能完成所有评分标准,其中Gemini 3 Pro还在流感HA任务中取得8/10成功。o3和Claude Opus 4在未拒绝的尝试中表现良好,但因高拒绝率数据有限。GPT-4.1、Claude Sonnet 4和Gemini 2.5 Pro表现中等但均未能完成反向互补。
报告中的代表性数据
eGFP任务成功率
2025年8月-2026年1月,GPT-5在10次尝试中有9次成功设计并提交满足所有评分标准的eGFP DNA片段。
流感HA任务成功率
2026年1月,Gemini 3 Pro在10次尝试中有8次成功设计并提交满足所有评分标准的流感HA DNA片段。
物理验证结果
2025年,o3代理设计的DNA序列经SYNTAX合成仪生产后,按照其协议进行PCA组装、克隆和表达,成功产生荧光蛋白。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 完整任务设计理念与威胁模型:详细阐述了基于生物武器风险链的评估设计哲学,包括数字到物理过渡的瓶颈分析、非专家恶意行为者威胁场景的构建,以及任务如何映射到实际风险。
- LLM agent评估方法论:深入介绍了任务型agent评估在更广泛评估生态中的定位,包括知识基准、受控研究/提升试验和能力基准的分类,以及ReAct代理框架的配置细节。
- 分段评分系统与自动评分器设计:包含基于规则的DNA片段评分五大标准(API调用、序列编码、反向互补交替、限制性位点、终止密码子),以及基于LLM的转录本自动评分器和协议自动评分器的提示词模板。
- 实验执行与参数配置:提供了8个前沿模型的完整测试参数(模型ID、消息限制、推理预算、温度设置),以及三批测试的时间线和工具集差异说明。
- 逐模型详细性能分析:附录D以叙事方式展示了每个模型在eGFP和流感HA任务上的行为模式、失败类型和成功轨迹,包含额外的热力图和案例分析。
- 物理验证实验完整步骤:附录C详细记录了o3代理设计序列的实验室合成、组装、克隆和表达全过程,包括o3生成的原始协议、研究伙伴的注释修改、产量比较和菌落计数数据。
- Biomni专用agent测试结果:附录E报告了在Biomni生物医学代理框架上执行的附加测试,包括与标准ReAct代理的性能对比和独特的失败模式。
- 限制与未来工作方向:明确讨论了评估在生物学方面、任务实现方面和自动评分方面的局限性,并提出扩展病原体种类、增加风险链覆盖率和系统化物理验证等后续建议。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。
相关报告

Measuring Biological Capabilities and Risks of AI Agents: Generating and Interpreting Evidence from Agentic Evaluations

Mapping the Informal Bioeconomy: Assessing the Current Landscape and Opportunities for Reinforcing Biosafety and Biosecurity

Can LLM Agents Select and Engage with Biological Tools? An Initial Biosecurity Assessment

Securing AI Algorithmic Insights

Toward Comprehensive Benchmarking of the Biological Knowledge of Frontier Large Language Models
