报告概述

本报告由北京第二外国语学院数字文旅研究中心发布,首次系统构建了AI旅行助手综合评价体系,包含可用性、易用性、个性化、安全性、流畅性五大维度,并据此对飞猪问一问、同程程心AI、支付宝出行助手、小红书点点、携程问道、腾讯元宝、字节豆包和DeepSeek八款主流产品进行横向评测。评测覆盖酒店、出行、景点、餐饮、路线等九大典型旅行场景,旨在为行业树立能力基准,帮助用户选择合适工具,并为产品迭代提供方向。

报告的核心结论

OTA与泛生活平台应用凭借数据和内容生态领先

评测显示,具备实时数据与成熟服务生态的OTA平台应用(如飞猪问一问、携程问道)及泛生活类内容社区平台应用(如小红书点点)在整体表现中领先。飞猪问一问凭借完整旅行生态与多场景协同能力位列榜首,小红书点点在垂直内容深度上表现突出。通用大模型产品虽交互自然,但在个性化推荐与多模态能力方面存在明显短板。

AI旅行助手强于灵感激发,弱于执行落地

在景点、活动及路线推荐等“灵感激发”类场景中,行业整体表现优异;但在依赖实时数据与复杂逻辑的出行方式推荐、行程安排及餐饮推荐等场景中,整体得分显著下滑,暴露出AI在多目标优化与实时服务落地方面的技术瓶颈,行业需要突破从信息整合到服务执行的闭环。

各产品基础能力趋同,但智能短板各异

各产品在需求理解、内容安全合规与个人数据脱敏等基础维度上普遍接近满分,但多模态能力、隐性个性化推荐与输出内容体验成为全行业共性短板。不同产品类型存在差异化瓶颈:通用模型弱于行程规划,OTA平台疏于隐性个性化,支付宝出行助手受限于外部数据准确性。

报告回答的关键问题

哪些AI旅行助手最好用?

根据评测总得分排名,飞猪问一问综合表现最好,其次为同程程心AI和支付宝出行助手,三者均属于具备实时数据和生态优势的平台。小红书点点在垂直内容场景中表现突出。通用大模型如豆包、DeepSeek整体得分靠后,主要短板在个性化与多模态能力。

AI旅行助手能代替人工规划吗?

目前尚不能完全替代。报告指出,AI旅行助手在灵感激发类场景(如景点推荐、玩法推荐)表现较好,但在需要实时数据和多目标优化的执行落地场景(如出行方式推荐、行程安排)中表现乏力,用户仍需自行校验和调整。

如何评价AI旅行助手的能力?

报告从可用性、易用性、个性化、安全性、流畅性五大维度构建评价体系。其中可用性考察需求理解、信息准确和规划合理,是基础能力;易用性关注交互体验;个性化衡量需求匹配;安全性包括数据脱敏与内容合规;流畅性考察响应速度。八款产品在基础维度上表现趋同,但高级能力差异显著。

报告中的代表性数据

飞猪问一问第一,DeepSeek最后

总得分排名

2025年9月22日-10月14日,八款AI旅行助手总得分排名:飞猪问一问 > 同程程心AI > 支付宝出行助手 > 小红书点点 > 携程问道 > 腾讯元宝 > 字节豆包 > DeepSeek。

需求理解、内容安全合规、个人数据脱敏接近满分;多模态能力、输出内容体验、规划合理得分最低

二级指标得分最高和最低

2025年9月22日-10月14日,各产品在二级指标得分中,共性优势指标为需求理解、内容安全合规、个人数据脱敏(普遍超9.5分);共性短板为多模态能力、输出内容体验、规划合理。

活动及玩法推荐最高(约81分),出行方式推荐最低(约74分)

各场景整体得分范围

2025年9月22日-10月14日,九个评测场景中,活动及玩法推荐场景整体得分最高,出行方式推荐场景得分最低(74.02分),显示AI在复杂实时决策场景的能力不足。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 评价体系构建过程与指标详解:包括自顶向下的理论推导(基于D&M模型、TAM、KANO模型)和自底向上的语料归纳方法,以及五大一级指标、二级指标和24个三级指标的完整定义与评分细则。
  • 九大评测场景下各产品的详细得分与排名:活动及玩法推荐、路线推荐、景点推荐、酒店推荐、景点问答、购物点推荐、餐饮推荐、行程安排、出行方式推荐,每个场景均有柱状图展示各产品得分。
  • 各产品二级指标得分总排名:以雷达图形式展示八款产品在需求理解、信息准确、规划合理、语音交互、多模态等十多个二级指标上的得分对比,清晰呈现各产品的优势与短板。
  • 功能性指标对比分析:包括需求引导能力、语音交互能力、预订选择多样性、历史记忆能力、支持行程调整或指定、输出响应速度、工具调用速度、预定链接可靠性等七项未直接参与评测的功能性指标得分表。
  • 研究结论与优化建议:针对OTA平台、通用大模型、泛生活类平台分别提出具体的优化方向,如加强隐性个性化推荐、优化行程规划能力、提升多模态能力等。
  • 未来展望与后续工作计划:预测AI旅行助手将向多模态交互、实时动态规划、智能体集成方向发展,并提出自动化与人工测试融合、指标体系优化、测试集合更新、开放共享平台建设等后续计划。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告