报告概述
本报告聚焦于当前企业广泛采用AI但普遍面临信任危机的现象。报告揭示了AI模型的高幻觉率、企业对其输出缺乏足够监督的现状,以及由此引发的财务、声誉和法律风险。通过分析多项调研数据与真实案例,报告指出能力(即准确完成任务)是建立AI信任的最关键因素,并介绍了基于准确数据与人工审核的AI系统如何帮助企业获得可信赖的结果。
报告的核心结论
大多数企业AI部署未能产生显著财务回报。
报告引用麦肯锡调研,88%的企业在至少一个业务领域使用AI,但仅有39%报告了全公司层面的财务影响(以EBIT衡量),表明AI的商业价值尚未广泛兑现,多数企业仍停留在实验阶段。
不准确性是AI带来的最大风险。
在已受到AI负面影响的企业中,30%归因于不准确性,远高于可解释性、隐私、网络安全等其他风险。报告强调,每次错误输出都会侵蚀信任、浪费资源并放大战略风险,超过一半的组织正在采取措施缓解这一问题。
主流AI模型存在严重幻觉,且很少承认不确定性。
根据哥伦比亚新闻评论2025年3月的测试,当要求识别并引用新闻来源时,各模型的完全或部分错误率从37%到94%不等。模型通常自信地给出错误答案,极少表示不确定,这一“自信幻觉”误导团队并放大风险。
近半数企业仅对少数AI输出进行人工审查。
麦肯锡调查显示,约43%的企业只审查40%或更少的生成式AI输出,只有21%的企业审查超过81%的输出。这种监督缺口导致许多企业在未验证的情况下依赖可能完全错误的AI回答。
能力(准确性)是建立AI信任的最强驱动因素。
通过对562项人类对AI信任研究的系统回顾,报告发现能力(系统有效执行任务的能力)被引用次数最多(92次),远超拟人化、可解释性等因素。要实现可靠的结果,领导者需要投资于既胜任又透明的AI。
报告回答的关键问题
企业使用AI的主要风险是什么?
报告指出,最大的风险是AI的不准确性。30%的受负面影响企业归因于此,其他风险包括可解释性不足(14%)、隐私问题(11%)、网络安全(10%)等。不准确性导致错误决策、合规风险与信任危机。
当前AI模型的幻觉率有多高?
根据2025年测试,不同模型的幻觉率差异很大:Perplexity(37%)、Copilot(40%)、Perplexity Pro(45%)、ChatGPT(67%)、DeepSeek(68%)、Grok-2(76%)、Gemini(77%)、Grok-3(94%)。所有模型均会在识别新闻来源时给出错误答案。
企业如何建立对AI的信任?
基于562项研究的分析,最重要的信任驱动因素是AI系统的能力(即准确完成任务),被引用92次。其次为个体因素(67次)、可解释性(47次)和隐私风险(41次)。报告建议投资于既胜任又透明的AI,以能力为基础逐步建立信任。
为什么AI幻觉在企业中尤其危险?
因为AI的输出往往看起来自信且条理清晰,但可能完全错误。在自主智能体场景中,一个错误的数据点会引发连锁反应,放大风险。同时,近半数的企业仅审查少量AI输出,导致错误未被及时发现,可能造成财务损失、声誉损害和法律风险。
报告中的代表性数据
企业AI使用率
2025年6月-7月,麦肯锡在线调查显示,88%的公司在至少一个业务职能中使用AI。
AI幻觉率范围
2025年3月,哥伦比亚新闻评论测试,不同模型在识别新闻来源时的完全或部分错误率。
低监督企业比例
2024年7月,麦肯锡调查,43%的企业只审查40%或更少的生成式AI输出。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 报告分析了AI幻觉的普遍性及其对企业的影响,包含麦肯锡、哥伦比亚新闻评论等来源的最新调研数据。
- 详细列出了主流AI模型(如ChatGPT、Gemini、Grok等)在准确性测试中的表现对比,附有完整的错误率统计。
- 展示了企业AI监督水平的分布情况,揭示低、中、高三种监督等级的企业比例,以及对应的风险暴露程度。
- 收录了5个AI幻觉导致严重后果的真实案例(如法律纠纷、财务损失),说明风险的具体表现形式。
- 系统梳理了562项关于人类信任AI的研究,总结出能力、可解释性、隐私等关键信任驱动因素的引用次数。
- 介绍了Terzo旗下产品NirvanAI的技术架构,包括99%准确率的数据基础、人工审核机制以及智能助手、智能体、自动化三大功能模块。
- 提供了NirvanAI的实际效益数据,如90天内收回投资、降低10%以上供应商支出、合同审查速度提升50倍等。
- 包含详细的目录索引,涵盖AI幻觉年龄、主要风险、模型幻觉率、监督现状、信任构建方法等章节,方便读者快速定位内容。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





