报告概述
本报告属于广发证券GenAI系列研究,研究对象为豆包大模型1.8(Doubao-Seed-1.8)与千问APP接入高德地图两大事件。报告覆盖了豆包大模型家族的性能迭代、Tokens增长与商业化路径,以及千问APP通过接入高德实现从信息问答到现实世界服务执行的跨越。主要分析内容包括:豆包1.8在多模态理解与智能体执行力上与Qwen3的对比、Seedance 1.5 Pro的视频生成能力、算力成本优化趋势,以及千问、豆包与DeepSeek在出行场景中的实测对比。报告采用产品测评与数据追踪相结合的方法,通过实测案例和官方数据揭示模型能力差异。价值在于帮助读者理解大模型竞争格局的演变,以及Agent生态整合对行业的影响。
报告的核心结论
豆包大模型1.8性能大幅提升,多模态理解与智能体执行力比肩Qwen3。
豆包1.8在数学推理、视频解析、智能体编程等核心维度上超越Qwen3,例如AIME-25得分94.3对87.2,多模态MMMU-Pro得分73.2对69.3。尽管复杂指令遵循维度稍逊,整体综合能力在实际应用中具有竞争力。
豆包大模型商业化路径逐渐清晰,推理算力需求驱动增长。
截至2025年12月18日,豆包日均Tokens使用量突破50万亿,较9月的30万亿大幅增长。在价格持平下通过Token效率优化降低算力成本,使得应用端算力消耗增速低于Tokens增速,商业化模型跑通。
千问APP接入高德,实现AI Agent从意图理解到现实服务执行的跨越。
千问通过API调用高德实时路况、扫街榜等数据,可直接规划路线、推荐餐厅并生成链接。相比豆包和DeepSeek仅提供文字建议,千问具备“办事”能力,向超级Agent迈出关键一步。
科技竞争重心从商业模式转向硬科技实力。
报告认为,大模型依赖长期基础研究与算力工程,难以速成。头部企业押注技术与人才,中国科技产业迎来由技术主导竞争格局的时刻,区别于移动互联网的商业模式驱动。
报告回答的关键问题
豆包大模型1.8相比前代有哪些关键提升?
豆包1.8在工具调用、复杂指令遵循及OS智能体等维度显著增强,支持单次1280帧视频解析,多模态理解上超越Qwen3。在数学推理(AIME-25得分94.3)、智能体编程(TerminalBench 45.6)等指标表现突出,同时通过MoE架构优化降低算力成本。
千问APP接入高德地图有什么实际意义?
千问APP接入高德后,用户可直接通过AI获取实时路线规划、餐厅推荐等可执行服务,如生成包含关键决策信息的路线卡片。这标志着AI从文本建议跨越到现实世界服务执行,为超级Agent整合更多应用(如淘宝、饿了么)提供可复制范式。
大模型商业化路径如何实现算力成本优化?
豆包大模型通过MoE稀疏架构、多模态联合训练和分阶段预训练微调,提升训练效率。针对Agent场景减少多轮重试与无效推理,降低冗余算力消耗。在单位推理成本下降趋势下,Tokens增速高于算力成本增速,使商业化模型可长期运营。
当前AI Agent发展面临哪些主要风险?
报告指出三大风险:一是AI大模型应用竞争加剧,生态体系存在不确定性;二是商业回报效果仍需时间验证;三是Agent应用整合过程中,不同业务的能力成熟度、数据权限及流程标准化程度不一,可能导致体验不一致或整合困难。
报告中的代表性数据
豆包大模型日均Tokens使用量
截至2025年12月18日,较2025年9月的30万亿大幅增长,自发布以来增长417倍。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 豆包大模型Tokens增长趋势图:展示2024年5月至2025年12月日均Tokens使用量变化,直观反映模型商业化规模。
- Doubao-Seed-1.8与Qwen3详细能力对比表:涵盖数学、推理、指令遵循、智能体等维度得分,支撑性能结论。
- Seedance 1.5 Pro视频与音频多维度雷达图:对比Kling 2.6、Veo 3.1,显示音画同步与质量优势。
- 千问、豆包、DeepSeek三款APP出行场景实测截图:包括路线规划、餐厅推荐等场景的详细对比,突出千问的可执行性。
- 火山引擎模型家族全景图:展示图像创作模型Seedream 4.5、语音识别模型2.0等产品矩阵。
- 推理侧算力受益标的分析:列出AI芯片、服务器、基础软件等环节的上市公司,并附估值表。
- 阿里生态图:展示千问APP接入高德后可能扩展的淘宝、飞猪、饿了么等应用想象空间。
- 风险提示与投资建议:包含模型竞争、商业回报验证、Agent整合不确定性等风险,及具体推荐公司。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





