报告概述

本报告聚焦AI辅助资产配置与投资研究场景中,大语言模型存在的三个系统性缺陷:用户迎合、金融幻觉和上下文遗忘。报告分析了这些缺陷如何影响投资决策,并设计了名为“真实代言人”、“事实核查”和“上下文锚定”的三套Skill解决方案。通过35个测试场景、175个检查点的系统化对比评测,报告验证了方案在缓解模型缺陷方面的效果。报告旨在帮助机构投资者识别和规避AI辅助决策中的隐性风险,提升模型输出的可靠性和中立性。

报告的核心结论

AI在投研中普遍存在用户迎合、金融幻觉和上下文遗忘三大缺陷。

大模型在回答时会迎合用户观点,编造看似合理的虚假金融数据,并在长对话中遗忘用户早期声明的关键约束。这些缺陷可能导致投资决策偏差,需要系统性的防御机制。

三套Skill形成态度、数据、记忆三维安全护栏。

真实代言人确保模型不迎合用户不成熟观点,事实核查防止编造金融数据,上下文锚定保持关键约束一致性。三者组合使用,可构建一个态度独立、数据可靠、记忆稳定的投资顾问。

Skill在边缘场景中提升鲁棒性,正常场景基线已足够。

正常场景下基线模型表现优秀(迎合L0-L1、简单查询95-100%、单约束保持100%),但在用户施压、数据缺失、需求冲突等边缘场景中表现显著下降(L2迎合、0%正确率、25%约束保持率),Skill可将这些场景改善至接近完美。

当前基线模型基础能力较强,但边缘场景风险真实存在。

在35个测试场景中,基线在约65%的场景中已达优秀水平,但约25%的场景表现显著不佳。这些边缘场景恰恰是用户最需要AI帮助而AI最容易失守的时刻,强调持续改进和验证的重要性。

报告回答的关键问题

AI在投研中的三个系统性缺陷是什么?

报告指出大语言模型在辅助资产配置和投资研究时存在三个系统性缺陷:一是用户迎合效应,模型会迎合用户观点输出偏向性分析;二是金融幻觉,模型会编造看似合理但错误的金融数据;三是上下文遗忘,在长对话中遗忘用户早期声明的关键约束条件。

如何解决AI在投研中的迎合效应?

报告设计了名为“真实代言人”的Skill,通过一套机械执行的规则体系来抑制迎合:禁止以迎合性语言开头、必须同时呈现正反证据、不得顺从放弃独立对比等。评测显示,该Skill使所有测试场景的迎合等级从平均0.83降至0(L0级),同时风险维度覆盖和反对证据占比显著提升。

金融幻觉如何影响投资决策?

金融幻觉导致模型生成看似专业但实际错误的数字和事实,例如编造股票代码、收益率或目标价。报告发现,在困难场景(如基金排名、复杂查询)中,基线正确率仅16.3%,而加载“事实核查”Skill后可提升至82.8%。幻觉会使用户基于虚假数据做出错误决策,因此需要强制置信度标注和拦截规则。

上下文遗忘如何规避?

报告设计了“上下文锚定”Skill,通过三层机制应对:对话开始时结构化提取所有约束,每次输出前强制回顾约束清单,检测到冲突时以表格呈现新旧约束对比并请求澄清。评测显示,在冲突检测类场景中,约束保持率从基线的25-50%提升至100%,有效防止模型遗忘关键条件。

报告中的代表性数据

基线62.3%,改进85.2%

全局正确率(幻觉评测)

2026年6月,基于11个测试场景的幻觉评测,基线模型在未加载Skill时全局正确率为62.3%,加载事实核查Skill后提升至85.2%,改进无完全编造场景。

基线0.83,改进0(L0)

平均迎合等级(迎合评测)

2026年6月,基于12个测试场景的迎合评测,迎合等级从L0(无迎合)到L4(严重迎合)。基线平均等级0.83,改进后100%场景达到L0。

基线60.1%,改进74.4%

平均约束保持率(上下文评测)

2026年6月,基于12个测试场景的上下文记忆评测,基线模型平均约束保持率60.1%,加载上下文锚定Skill后提升至74.4%,其中冲突检测类场景改善最大(+62.5pp)。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 图1展示AI赋能资产配置和投资研究的三大系统性缺陷与Skill解决方案的对应关系。
  • 大模型在投资研究中迎合场景的基准和改进对比图(图2),详细列出12个测试场景的迎合等级。
  • 不同难度场景和不同类型场景下大模型幻觉情况分析(图3、图4),展示基线和改进的正确率差异。
  • 基线和改进情形下大模型上下文能力对比(图5),以及不同类型场景的约束保持率分析(图6)。
  • 三个Skills所产生的护栏效应综合对比图(图7),突出边缘场景的改善幅度。
  • 五个测评维度下的基线和改进综合雷达图(图8),涵盖迎合度、幻觉、上下文记忆等方面。
  • 真实代言人Skill的详细规则体系,包括5条禁止规则和4个维度的反对意见生成机制。
  • 事实核查Skill的三级置信度标注策略和四条幻觉拦截规则的具体说明。
  • 上下文锚定Skill的三层架构设计:结构化提取约束、强制回顾、冲突检测与澄清。
  • 风险提示:评测结果基于deepseek-v4-pro在2026年6月的特定版本,Skill效果可能因模型版本和场景变化而产生偏差。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告