报告概述

本报告为海外科技行业AI领域的专题研究,围绕谷歌Gemini 3大模型、TPU自研芯片与端侧AI应用三大主题展开系统分析。研究覆盖模型能力评测、Agent落地路径、算力竞争格局、云业务差异化竞争等多个层面,并延伸至产业链投资标的梳理。报告采用模型、算力、应用三层递进的分析框架,结合第三方基准测试数据、产业链调研与财务测算,对谷歌全栈AI生态的构建逻辑和端侧AI的商业化前景进行了深入拆解。对于关注AI技术演进、算力市场格局变化以及端侧应用落地的投资者而言,这份报告提供了从技术趋势到投资方向的完整参考。

报告的核心结论

Gemini 3验证预训练Scaling Law仍然成立

报告认为,Gemini 3能力的大幅跃迁主要得益于预训练上的算力投入突破,这侧面证明了预训练Scaling Law依旧成立。同时,谷歌拥有搜索、YouTube、Chrome等生态产生的独家且不可迁移的用户行为数据,构建了理解用户意图和上下文的强大壁垒。算力投入与数据壁垒共同支撑了谷歌在AI全栈技术+全面应用场景上的独特生态优势。

多模态能力突破加速端侧AI Agent落地

报告指出,Gemini 3在屏幕理解能力上的大幅提升,使AI Agent真正具备视觉智能和界面逻辑理解能力,为端侧实现GUI操控提供了可能。豆包手机助手已率先通过跨APP比价场景验证了商业化路径,模型正从创意工具升级为生产力工具,在广告设计、动漫绘制、产品设计、教育作业、医疗影像诊断等场景的应用有望加速释放。

TPU长期作为英伟达GPU的补充而非颠覆

报告认为,虽然谷歌TPU在TCO、集群扩展性、灵活性上有明显优势,但英伟达凭借供应链壁垒、CUDA生态成熟度和一年一迭代的能力,仍将主导AI芯片市场。TPU将主要占据特定客户的细分场景,形成GPU为主、TPU补充的长期竞争格局。TPU对谷歌更重要的战略意义在于构建全栈AI生态,并通过赋能云业务赚取更高利润,而非出售TPU本身。

OS级权限掌控者将占据AI落地优势

报告认为,AI OS的好用性高度依赖于底层操作系统赋予的核心权限,跨应用数据互通、设备硬件调度、界面逻辑深度解析等关键能力均需OS层面的权限支撑。因此,拥有操作系统掌控权的苹果(iOS)与谷歌(安卓)在AI OS落地与体验优化上具备天然优势。报告看好谷歌全栈集成、苹果系统掌控、阿里模型能力三者的协同价值。

报告回答的关键问题

Gemini 3相比其他大模型有哪些核心提升?

Gemini 3在推理、上下文长度、代码能力、数学能力等维度全面跃升。百万token上下文窗口配合64k输出能力远超竞争对手,在MRCR v2测试中平均得分大幅领先;LiveCodeBench Pro中Elo得分2439,显著高于GPT-5.1;ECI指数154分刷新最高纪录。其多模态能力提升最为关键,为后续应用落地奠定基础。

谷歌TPU对英伟达GPU的冲击有多大?

报告认为,当前TPU的冲击主要集中在议价环节。OpenAI以转向TPU采购为谈判条件,成功从英伟达获得约30%的GPU采购折扣,但尚未形成实质性的份额替代。TPU v7在TCO、集群扩展性上具有优势,谷歌正通过生态建设大幅提升其外部可用性,使其成为英伟达GPU之外值得关注的重要算力选项。

端侧AI Agent如何解决APP权限限制问题?

GUI Agent(图形用户界面智能体)是绕开API权限的重要解决方案,其核心逻辑是感知→规划→行动的循环。Agent截取屏幕截图后,多模态大模型通过图像识别理解界面按钮、文本框等元素,预测需要点击的坐标,模拟人类操作手机。Gemini 3 Pro的屏幕理解能力为这一方案提供了技术支撑,豆包手机助手已通过跨APP比价等场景验证了该路线的商业化可行性。

谷歌在端侧AI领域有哪些优势?

谷歌坐拥安卓系统、Gemini模型、Pixel硬件入口和应用全家桶,具备从底层系统到上层应用的垂直整合能力。这一全栈布局实现了权限开放、技术协同、硬件适配与场景覆盖的全链路贯通,加上自研TPU在算力成本和效率上的优势,谷歌能够最大化端侧Agent功能的落地效率与体验上限,在行业竞争中优势凸显。

字节跳动为什么选择与中兴合作推出AI手机?

入口焦虑是核心原因。苹果凭借iOS系统将AI能力植入硬件底层,手机厂商也以系统级AI功能抢占入口,而字节在硬件和OS层均相对薄弱,难以获得底层操作权限。通过与中兴合作,字节主导大模型植入与AI交互定义,中兴主导硬件设计和生产制造,双方合作打造AI原生手机,使内嵌AI Agent拥有比普通APP更高的系统权限,弥补字节的AI入口劣势。

报告中的代表性数据

152亿美元,同比增长34%

谷歌云季度收入

2025年第三季度,谷歌云2025年Q3收入达152亿美元,同比增速34%,AI基础设施需求为主要驱动力。截至当季末,谷歌积压订单达1577亿美元,主要由Anthropic订单贡献。

自用低44%,租赁低30%

TPU v7相对GB200的TCO优势

2025年,据Semianalysis测算,在相同负载下,谷歌自用Ironwood集群的全包推理TCO比GB200服务器低44%;对外租赁TPU v7并获利的情况下,每小时TCO比GB200低约30%、比GB300低约41%。

45.1%

Gemini 3 Deep Think通用推理能力得分

2025年,在ARC-AGI-2测试中,Gemini 3 Deep Think取得45.1%得分,大幅超越前代Gemini 2.5 Pro(4.9%)与GPT-5.1(17.6%),该测试主要衡量AI从有限示例中提取核心规律并应用于新情境的通用推理能力。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • Gemini 3与Banana模型能力全景评测:报告从推理能力、上下文窗口、代码能力、数学能力、多模态理解与生成等多个维度,对Gemini 3 Pro、Gemini 3 Deep Think及Nano Banana Pro进行了详细评测,并对比了GPT-5.1、Claude Sonnet 4.5等主流模型,包含MRCR v2、LiveCodeBench Pro、ARC-AGI-2、ScreenSpot-Pro、AIME 2025等多项权威基准测试数据。
  • Agent能力全链路突破分析:深入解析Gemini 3如何以智能体为核心,实现从感知、决策到执行的全链路突破,覆盖多模态信息综合处理、屏幕理解、GUI操控等核心技术能力,并介绍了谷歌发布的Agentic编程平台Antigravity及其对Cursor等AI编程工具的挑战。
  • GUI Agent技术原理与落地路径:系统介绍GUI Agent“感知→规划→行动”的工作循环,解释其如何通过屏幕截图、多模态识别、坐标预测等方式绕开API权限限制,并分析了视觉定位精度、动态与延迟等落地难点,以及Gemini 3 Pro在ScreenSpot-Pro测试中展现的核心竞争力。
  • 端侧Agent商业化案例分析:以豆包手机助手为对象,介绍其通过“系统权限+多模态模型+GUI操控”组合模式打通跨应用执行闭环的实践,包括跨APP比价、下单等场景展示,并分析了字节跳动与中兴通讯合作推出AI原生手机努比亚M153背后的入口焦虑与战略考量。
  • TPU v7性能、生态与TCO全面分析:从单卡FP8稠密算力、HBM3e内存配置、有效利用率等维度解析TPU v7硬件实力,对比英伟达B200/GB200/GB300等产品,详述谷歌在PyTorch原生支持、vLLM/SGLang推理生态集成、Paged Attention内核开源等生态建设方面的进展。
  • 谷歌云差异化竞争与增长引擎解析:分析“TPU+Gemini+Vertex AI”全栈方案如何帮助谷歌云掌握算力定价权,通过EBIT Margin测算展示其盈利能力领先优势,并解读Anthropic百万颗TPU订单、Meta意向部署等关键客户案例,以及谷歌云收入与积压订单的增长数据。
  • TPU与英伟达GPU长期竞争格局研判:从供应链壁垒、软件生态开放性、迭代速度三个维度对比TPU与英伟达GPU的竞争优劣势,分析OpenAI利用TPU采购获得GPU折扣等议价博弈案例,判断GPU为主、TPU补充的长期市场结构,以及Anthropic、Meta等客户的技术路线选择。
  • 重点推荐标的与盈利预测:覆盖谷歌、英伟达、台积电、博通、苹果、阿里巴巴六家标的,分别从全栈AI能力、算力供应链、芯片代工、端侧硬件入口、模型能力等角度阐述推荐逻辑,并提供截至2025年12月2日的收盘价、EPS预测、PE估值及投资评级数据。
  • 行业风险提示:报告在正文末尾列出AI应用落地不及预期风险、AI资本扩张效率较低风险、端侧隐私风险三项核心风险,提示投资者关注技术商业化节奏、资本投入产出效率以及隐私安全合规等方面可能面临的不确定性。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告