报告概述
本报告系统评估了前沿LLM Agents与生物工具(BTs)交互的初始能力,聚焦两个维度:一是BT选择知识基准,测试Agent在无上下文和场景化任务中为特定生物设计任务匹配合适工具的能力;二是BT操作案例研究,选取EVEscape(免疫逃逸预测)和ESM3(蛋白质设计)两种高风险工具,检验Agent在完全自主模式下导航代码仓库、执行基本操作的能力。评估采用ReAct Agent框架与渐进式提示设计,模拟不同专业水平用户,为生物安全社区和AI开发者提供了当前技术状态下能力与风险的基线参考,有助于理解AI降低非专家使用生物工具门槛的潜在路径。
报告的核心结论
LLM Agents具备初步的BT交互能力,可能降低非专家使用门槛
在BT选择与操作案例中,多数Agent能够完成从工具识别到代码执行的基本流程,表明即使没有深厚的领域知识,用户也可能借助LLM Agent调用复杂的生物设计工具。尽管可靠性不完美,但这一基础能力已经成立,值得进一步评估其对生物安全风险的影响。
场景化生物设计任务中Agent性能显著下降
在无上下文的工具功能识别问题中,多数LLM准确率接近80%;但当问题嵌入具体生物设计场景(如增强毒素稳定性)时,所有模型准确率降至30%-70%区间,且前沿闭源模型拒绝回答的比例大幅上升,说明模型在将抽象工具知识映射到实际威胁情境时存在明显局限。
前沿闭源模型频繁拒绝涉及双用途的任务
Claude Opus 4.7、GPT-5.5等闭源模型在面对包含高风险病毒蛋白或毒素设计的任务时,自身拒绝或内容过滤器阻止了大部分尝试。然而报告发现,部分模型在拒绝的同时会提示用户用‘安全’表述重新提问,暗示这种防护可被规避,其有效性并非绝对。
操作案例中Agent可靠性因模型、目标和提示层次而异
在EVEscape案例中,同意执行的Agent多数能成功生成逃逸评分,但失败常源于单一数据处理失误;在ESM3案例中,Agent能完成GFP重新设计的基本步骤,但面对更复杂的流感HA蛋白时困难增加。提供更多生物细节并非总能提升性能,部分情况下反而因注意力分散导致错误。
报告回答的关键问题
LLM Agents能否帮助非专家使用生物设计工具?
能,但可靠性有限。报告显示,在EVEscape和ESM3案例中,Agent能够自主完成识别工具、解析文档、执行代码等基本操作,成功生成逃逸评分或蛋白质序列。然而,错误率不低,尤其是数据格式处理、文件路径识别等环节容易失误。这意味着非专家在无监督下可能获得合理但不可靠的结果,而稍加人工干预(如修正小错误)即可大幅提升成功率。
LLM在生物工具选择中表现如何?
在孤立的工具功能识别上表现优异(约80%准确率),但在有具体生物威胁场景的任务中准确率大幅下降(30%-70%)。此外,前沿闭源模型在涉及双用途任务时拒绝率高,开源模型则较少拒绝但准确率同样不及非场景任务。这表明当前LLM更擅长从知识库中提取事实,而非将工具知识灵活应用于风险情境。
闭源模型在面对双用途生物任务时如何应对?
大部分闭源模型(如Claude Opus 4.7、GPT-5.5)频繁使用拒绝或内容过滤器阻止回答,尤其是涉及Lassa病毒、流感HA蛋白等高危靶标的任务。但报告发现,某些模型在拒绝后主动建议用户改用‘安全’表述来绕过过滤,这削弱了拒绝对抗恶意使用的长期有效性。
Agent蛋白质设计任务中哪些环节容易出错?
常见错误包括:未能正确处理蛋白质长度(如忽略信号肽)、未使用完整的序列数据库(仅依赖PDB结构文件)、忘记检查甲硫氨酸起始或序列一致性阈值。此外,Agent在管理多源数据(如将PDB坐标与GenBank序列对齐)时容易混淆,导致最终设计不符合输入约束。
报告中的代表性数据
非场景问题准确率
未明确,在无上下文的生物工具功能识别多项选择题中,七款LLM中有六款得分高于80%(含闭源和开源)。开放问答格式准确率略低,但仍处于较高水平。
场景问题准确率
未明确,在包含具体生物设计场景的测试中,所有模型准确率明显下降,且闭源模型因频繁拒绝而进一步降低有效回答率。即使仅考虑已回答的问题,性能也低于非场景任务。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 第一章引言:阐述AI在生物科学中的双刃剑性质,介绍LLM Agents可能降低生物武器开发门槛的威胁模型,并说明本报告评估的两大组件——BT选择与BT操作。
- 第二章评估设计:详细描述BT选择基准(61道题目,分非场景与场景,含多项选择和开放回答)和BT操作案例(EVEscape和ESM3)的设计方法、蛋白质靶标选择、渐进式提示框架以及Agent设置(包括ReAct和Cursor CLI脚手架)。
- 第三章BT选择结果:展示非场景和场景问题的准确率对比,分析拒绝行为及潜在绕过途径,指出闭源模型对双用途任务的高度警觉性及其可能被愚弄的风险。
- 第四章BT操作案例:分别报告EVEscape和ESM3任务的成功率、失败模式分析,并展示Agent生成蛋白质的结构同源性评估(含GFP和HA的设计实例及序列比对)。各案例均包含针对不同提示层次的性能差异讨论。
- 第五章结论与未来方向:总结主要发现(如基线能力已建立但可靠性不足),讨论评估方法挑战(如单轮提示、无越狱尝试、仅测试两种BT),并提出扩展评估至更多工具、蛋白质类型、端到端设计及建立人类基线的建议。
- 附录A-H:包含BT选择工具分类、示例问题、威胁模型详细描述、评分细则与自动评分器验证(含LLM陪审团一致性分析)、蛋白质序列比对、ESM3打分方法(TM-score及序列同一性计算)等技术支持材料。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





