报告概述

本报告围绕全球大模型产业的结构性拐点,系统梳理从“快思考”到“慢思考”、从“生成”到“行动”的演进路径。报告覆盖海外与国内主要厂商,包括Google、OpenAI、Anthropic与DeepSeek、字节豆包、阿里千问、快手可灵等,从技术架构、产品形态、生态布局和商业变现等多个维度展开分析。报告采用System 1/System 2理论框架,结合基准测试、财务数据和案例研究,评估各厂商在推理能力、入口掌控和行动执行上的竞争格局,并在此基础上提出投资建议。对于关注AI技术演进、应用落地和投资机会的读者,本报告提供了系统性的参考框架。

报告的核心结论

全球大模型从快思考走向慢思考,竞争重心转向算法与训练范式优化。

报告指出,2025年四季度头部厂商竞争从追求对话速度和表层生成质量,转向构建长链条推理、自我反思与工具调用能力。真正具备持续竞争力的不再是更大模型,而是单位算力下更高的有效智能密度、更稳定的思考链以及更优的成本效率。

AI竞争焦点从跑分领先转向直达用户、驱动行动,AI从生成走向行动。

行业焦点从基准测试榜单迁移到真实场景中改造用户行为与任务流程。模型能力嵌入操作系统与超级App,将自然语言直接翻译为可执行动作,成为新一轮入口争夺核心。以Gemini 3的搜索即软件、豆包OS级智能体、千问服务原子化为代表。

AI正系统性重塑生产方式与人才结构,人类角色从手工生产者转向任务设计者。

在软件工程、内容生产与服务履约等环节,AI把人类从亲自写代码、剪视频推向设计问题、组织行动链、验收结果。Anthropic调研显示工程师角色被重塑,初级岗位被AI侵蚀,未来稀缺的是抽象任务链条与设定安全边界的能力。

国内厂商通过算法优化与生态协同,形成“模型—入口—算力”三线合围的中国样本。

DeepSeek以高推理密度+低成本开源路径,豆包、千问、可灵等在入口和场景侧落地,共同构建差异化发展路径。这一样本在算力约束下更注重实用主义,通过开源与场景深耕实现从卷规模向卷效率的转向。

投资判断应从标签化转向审视核心能力,关注具备闭环的厂商。

报告建议从有没有大模型、有没有Agent产品的标签判断,转向评估技术路径、入口掌控力和生产环节正反馈闭环。具备算法工程深度、高频入口与真实业务场景,且已跑通重构闭环的厂商有望获得更高估值弹性。

报告回答的关键问题

大模型为什么需要从快思考走向慢思考?

因为单次前向推理的“快思考”难以胜任复杂任务,容易产生幻觉和逻辑断裂。慢思考通过链式思维、自我验证和搜索校正,显著提升复杂任务正确率、Agent稳定性和安全合规性,是从“能说”走向“会做”的必要前提。

AI智能体如何改变应用入口和用户行为?

AI智能体通过OS级权限和API打通,将跨App操作、自动比价、一键行程规划等复杂任务压缩成一句话触发的动作流,用户不再需要逐个打开App。这导致应用首屏入口、广告位和推荐流量可能被管道化,商业模式面临重构。

国内大模型厂商如何实现弯道超车?

国内厂商侧重算法优化与工程创新,DeepSeek通过强化学习和长上下文优化,在开源框架下实现更强慢思考与更低成本;豆包、千问、可灵则聚焦入口和场景落地,形成“模型—入口—算力”三线合围,从卷规模转向卷效率。

AI对软件工程师岗位有什么影响?

AI深度嵌入编码工具后,工程师从亲手写代码转向拆需求、定架构、做验收,生产力大幅提升。初级工程师的成长路径被压缩,企业需要保留徒手调试训练场景,并将善用AI完成复杂系统交付的能力纳入考核。

报告中的代表性数据

LM Arena 1501分;Deep Think模式下Humanity's Last Exam 41.0%

Gemini 3在LM Arena及高难度推理测试中的得分

2025年11月发布后,Gemini 3在LM Arena以1501分登顶,开启Deep Think后Humanity's Last Exam得分从标准模式37.5%提升至41.0%,远超Claude Sonnet 4.5的13.7%。

为GPT-5的1/24、Gemini 3 Pro的1/29

DeepSeek-V3.2百万Token输出成本对比

2025年12月,DeepSeek-V3.2通过软硬件协同优化和长上下文强化学习,将百万Token输出成本压缩至闭源巨头的几十分之一,相较前代V3.1-Terminus在128K上下文下成本降低75%–83%。

1023亿美元,同比增长16%

Alphabet 2025年第三季度营收

2025年Q3,单季营收首次突破1000亿美元,其中Google Cloud收入同比增长约34%,在手订单约1550亿美元,显示AI基建和模型产品对收入的实质拉动。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整报告首先梳理了全球大模型技术演进路线图,从传统统计模型到大规模预训练模型,再到具备System 2慢思考、工具调用和长链推理能力的新一代架构,并以论文框架解释System 1向System 2转变的底层逻辑。
  • 针对Google,报告详细拆解Gemini 3的稀疏混合专家架构、百万Token上下文和Deep Think推理模式,并对比其在Humanity's Last Exam、GPQA Diamond、Math Arena Apex等基准中的表现,同时分析AI搜索重构对Google广告、云和订阅业务的财务影响。
  • 在OpenAI部分,报告回顾其在Gemini 3冲击下启动的“红色警报”机制,分析GPT-5.2在分层推理、成本控制和体验修复上的版本化反击策略,并比较各版本输入和输出成本差异。
  • 关于Anthropic,报告展示其企业级LLM市场份额和Claude Code在编码场景的领先地位,并基于内部调研呈现工程师生产力提升和角色结构重塑的实证数据。
  • 国内厂商部分,报告深入剖析DeepSeek-V3.2和V3.2-Speciale的推理能力与成本优势,豆包AI手机助手在OS级权限下的跨App任务链,千问App的服务原子化调度中枢,以及快手可灵在视频生成、音画同出和数字人方面的工业化升级。
  • 报告还从技术演进和应用维度总结“模型能力—入口形态—行动与生产重构”三步走主线,对比海内外大厂在系统级整合和本地高频场景上的不同路径。
  • 投资建议部分,报告列出AI应用产业链的重点关注标的,并给出技术迭代、商业化落地、政策支持和全球宏观经济四类风险提示。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告