报告概述

本报告系统比较了传统网络搜索(Google搜索)与四种生成式AI搜索引擎(Google AI Overview、Gemini、GPT-4o Search、GPT-4o with Search Tool)在多个查询领域的输出差异。研究覆盖一般信息、政治、科学、购物等六类数据集,共4606条查询,并从美国和德国两个地理位置进行实验。报告采用来源分析、内容概念归纳(LLooM)等方法,考察了来源多样性、内部知识与外部知识的依赖比例、概念覆盖广度等维度。读者可借此理解生成式搜索在信息呈现方式、来源选择及内容多样性上的新特征,并重新审视传统搜索评估标准的适用性。

报告的核心结论

生成式搜索引擎在来源选择上显著区别于传统搜索。

平均而言,Google AI Overview引用的域名中有53%不在传统搜索前十名结果中;GPT-Tool等模型引用的域名平均排名更靠前,但类型更集中,例如几乎不引用社交媒体。生成式搜索可综合超过十个来源,而传统搜索固定返回十条结果。

不同生成式引擎依赖内部知识的程度差异巨大。

GPT-4o with Search Tool平均每查询仅引用0.4个网页,而AI Overview引用8.6个,Gemini引用8.5个,GPT-4o Search引用4.1个。依赖内部知识的模型在时间敏感查询上表现不佳,如对“Ricky Hatton死因”给出错误信息。

生成式与传统搜索的整体话题覆盖相当,但具体概念存在差异。

在所有数据集上,AI Overview平均覆盖74%的发现概念,传统搜索覆盖78%,差异不大。但对模糊查询,传统搜索覆盖质量更高(中位覆盖率67% vs AIO的55%)。不同引擎覆盖的概念子集不同,部分概念被唯一覆盖。

生成式搜索在时间敏感查询上表现不稳定。

对于当日热门查询,AI Overview仅触发3%的案例;依赖内部知识的GPT-Tool在16%的查询中表现出不完整理解。而检索增强的系统(如GPT-4o Search)能保持较高覆盖。此外,生成式引擎的结果在两个月间隔内变化显著,AI Overview的链接Jaccard重叠仅18%。

报告回答的关键问题

生成式AI搜索与传统搜索有什么主要区别?

主要区别有三:输出格式上,生成式搜索返回连贯文本而非链接列表;来源覆盖上,生成式搜索能综合更多网页(AI Overview平均引用9条链接,而传统搜索固定10条);知识依赖上,生成式搜索混合使用模型内部知识与检索到的外部信息,各引擎依赖比例差异极大。

AI搜索能否覆盖更广泛的信息来源?

是的,生成式搜索倾向于覆盖更多样的来源。例如AI Overview引用的域名中有超过40%不在传统搜索前100名内。但来源的权威性有所降低:传统搜索89%的域名位于全球前100万热门网站,而AI Overview为85%,GPT-Tool为81%。生成式搜索更多使用百科和企业网站,较少引用社交媒体。

ChatGPT搜索和Google AI Overview哪个更好?

根据报告,两者各有优劣。AI Overview引用更多外部链接(平均8.6条),GPT-4o Search平均4.1条,GPT-4o with Tool仅0.4条。在话题覆盖上,GPT-4o Search覆盖78%的概念,略高于AI Overview的74%。但GPT-4o with Tool在时间敏感查询上表现较差。传统搜索在模糊查询上仍具优势。

生成式AI搜索如何影响信息多样性?

报告发现,生成式搜索与传统搜索在概念数量上接近,但每个引擎覆盖的概念子集不同,提高了整体多样性。然而,对于模糊查询(如人物重名),生成式搜索有时无法覆盖所有方面,传统搜索反而更全面。此外,依赖内部知识的模型可能压缩信息,遗漏次要视角。

生成式搜索的时效性如何?

生成式搜索的时效性差异明显。对于热门趋势查询,AI Overview很少被触发(仅3%),而GPT-4o Search和Gemini依赖搜索保持较高覆盖。GPT-4o with Tool因主要依靠内部知识,常无法获取最新信息。此外,生成式结果随时间波动大,AI Overview的链接在两个月后仅18%重复。

报告中的代表性数据

AI Overview平均8.6个链接/查询;GPT-Tool平均0.4个链接/查询;Gemini平均8.5个;GPT-Search平均4.1个;Organic固定10个。

搜索引擎引用的网页数量对比

2025年9月,数据基于所有数据集平均。GPT-Tool的引用数极低,表明高度依赖模型内部知识。

AI Overview引用的域名中有53%不在Organic前十名结果中;GPT-Tool与Organic的URL重叠接近0%。

生成式搜索与传统搜索的来源域名重叠

2025年9月,重叠度按URL或域名计算,显示生成式搜索大量使用非常见来源。GPT模型的重叠更小。

仅3%的Google趋势查询生成了AI Overview(美国地区)。

热门查询中AI Overview触发率

2025年9月15日,针对当日前100条趋势查询,AI Overview极少出现,而GPT-4o Search和Gemini主动搜索的比例较高。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整的数据集构建方法与统计:详细说明MS Marco、WildChat、AllSides、监管行动、科学查询、产品查询六类数据集的获取、筛选与预处理步骤,包括查询总数及各国触发AI Overview的比例。
  • 五大搜索引擎的配置与调用参数:列出Organic、AI Overview、Gemini、GPT-4o Search、GPT-4o with Search Tool的具体版本、API设置、温度参数及搜索半径,并解释每个引擎的搜索决定机制。
  • 来源分析的详细结果:包括各引擎引用链接的数量分布(图3)、域名流行度累计分布(图4)、URL和域名重叠度对比(图5、22-25)、以及按Google内容分类和自定义分类的网站类型占比饼图(图6、26-29)。
  • 基于LLooM的概念覆盖分析:展示各引擎在每个数据集上的概念覆盖率(图9)、概念密度与文本长度的关系(图10)、引擎间概念重叠(图11),以及针对模糊查询的覆盖表现(图36)。
  • 时间敏感性专门分析:针对2025年9月15日谷歌趋势热门查询的响应长度、来源排名、概念覆盖对比(图14-16),以及两个月间隔前后的链接和概念稳定性(图18-21)。
  • 多项附加对比实验:包括不同搜索上下文大小(低/中/高)对链接数、域名排名和概念覆盖的影响(图37-40),以及德国地区与美国地区的重复分析,验证结论的跨地区一致性。
  • 伦理考量与局限讨论:说明数据集隐私保护措施、分析仅限英文查询和两个地区、未考虑多轮对话和用户点击行为、使用LLM进行概念归纳的潜在偏差等。
  • 完整的参考文献列表:涵盖信息检索、LLM评估、搜索多样性、生成式搜索等相关领域的54篇文献,便于读者延伸阅读。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告