报告概述

本报告是一项系统性的文献综述,遵循PRISMA 2020指南,从2341篇文献中筛选出88篇进行深入分析。报告提出了基础模型工业智能体的工作定义,并采用结构化的编码方案评估了这些系统的技术成熟度、应用领域、系统目的和关键能力。通过与传统工业智能体系统的对比,揭示了基础模型带来的能力变化和部署瓶颈。读者可以通过本报告全面了解该领域的研究现状、关键技术局限以及未来的发展方向,为相关研究和实践提供参考。

报告的核心结论

多数基础模型工业智能体处于原型阶段,部署证据稀缺。

报告评估了系统的技术成熟度(TRL),结果显示75.0%的系统处于TRL 4-6的开发阶段,即实验室验证和演示水平;仅有9.1%达到TRL 7-9的部署阶段。这表明尽管原型开发快速,但将系统投入实际工业运营仍面临重大挑战。

系统目的从传统生产控制转向辅助与监控角色。

在88篇文献中,用户辅助是最常见的系统目的(占30.9%),其次为过程优化(16.1%)和监控(15.7%)。传统生产控制目的如计划(6.5%)、调度(4.8%)和派工(4.3%)的占比显著低于历史基线,反映出基础模型智能体更侧重于知识密集型和支持性任务。

人机交互和不确定性处理能力大幅提升,协商能力下降。

与传统工业智能体基线相比,基础模型智能体在人机交互能力上高出37个百分点,在应对不确定性能力上高出35个百分点。然而,协商能力下降了39个百分点,这与系统目的从分散式优化转向辅助型角色相一致。

主要局限包括泛化不足、幻觉与不稳定、数据稀缺和推理延迟。

报告总结了308条局限提及,最频繁的主题是泛化与现实世界验证不足(14.3%),其次是幻觉和不稳定输出(10.7%),数据质量与稀缺(10.7%),以及计算成本与延迟(9.4%)。这些限制阻碍了系统从实验室走向实际部署。

报告回答的关键问题

基础模型工业智能体的技术成熟度如何?

大多数系统处于实验室原型和早期验证阶段(TRL 4-6),占比75.0%。只有9.1%的系统达到部署阶段(TRL 7-9),说明从原型到实际运营的转化仍困难重重。报告指出,这一分布可能受到文献筛选标准影响,但总体反映了该领域的早期状态。

基础模型智能体相比传统工业智能体有哪些能力变化?

基础模型智能体在人机交互、应对不确定性、适应性和学习能力上显著增强。例如,人机交互能力覆盖率比传统智能体高37个百分点,应对不确定性高35个百分点。但协商能力下降了39个百分点,同步能力也有所降低,表明其更侧重语言交互和知识推理而非协调谈判。

基础模型工业智能体面临哪些主要挑战?

主要挑战包括:泛化能力不足(多数系统仅在实验室或特定场景验证)、幻觉与输出不稳定、高质量工业数据稀缺、推理延迟和计算成本高。此外,提示敏感、工具集成困难以及安全和隐私风险也是常见问题。这些局限需要在部署前得到解决。

基础模型在工业自动化中最适合哪些应用场景?

报告显示,基础模型智能体最适合用户辅助、过程优化和监控等知识密集型任务。例如,维护决策支持、工程设计自动化、能源系统管理和IT运维。相比之下,计划、调度和派工等需要强协商和确定性的传统控制任务使用较少。

报告中的代表性数据

75.0% 在开发阶段,9.1% 在部署阶段

技术成熟度分布

截至2025年9月,研究阶段(TRL 1-3)占15.9%,开发阶段(TRL 4-6)占75.0%,部署阶段(TRL 7-9)占9.1%。

人机交互 +37 个百分点,协商 -39 个百分点

能力变化(与传统智能体对比)

对比基线文献(2024年),基础模型智能体在人机交互(65.9% vs 28.8%)和应对不确定性(42.0% vs 6.7%)上有显著提升,而协商能力(3.4% vs 42.4%)大幅下降。

泛化不足14.3%,幻觉与不稳定10.7%

局限主题频率

基于88篇文献的308条局限提及,泛化与现实世界验证不足是最常见的局限,占14.3%;幻觉和输出不稳定以及数据质量与稀缺各占10.7%。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整的PRISMA文献检索流程和筛选细节,包括数据库查询字符串和排除标准。
  • 基础模型工业智能体的工作定义,以及如何从传统智能体概念和自动化工程标准推导而来。
  • 88篇纳入文献的详细编码数据,涵盖技术成熟度、应用领域、系统目的和能力标注。
  • 系统目的和能力覆盖率的完整对比图表,与传统智能体基线(Reinpold et al.)进行直接比较。
  • 基于能力指标聚合的四个高维属性(社会性、自主性、智能性、保真度)的分数分布图。
  • 所有局限和未来工作主题的完整频率列表和代表性引文,便于深入查阅。
  • 各个应用领域(生产制造、物流、工程设计与运维)中典型系统的案例描述。
  • 研究方法学的有效性讨论,包括编码歧义、选择偏差和基线比较的局限性。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告