报告概述

本报告以“海光DCU加速金融大模型落地实战”为主题,系统介绍了海光DCU(深度计算单元)在金融行业大模型应用中的技术架构、生态兼容性、性能优化及落地案例。报告覆盖了金融AI发展的三个阶段,重点阐述了第三阶段中算力、生态、量产可持续性等关键因素,并详细展示了海光DCU在软件栈(DTK、DAS)、千卡集群部署及具体业务场景(如编程自动化、智能客服、财报分析)中的实践成果。旨在为金融机构在国产芯片选型、大模型训练与推理部署提供参考。

报告的核心结论

金融AI进入深化应用阶段,国产芯片迎来市场机遇。

报告指出金融行业AI实践已从被渠道化、自主创新进入深化应用阶段。该阶段关注标称算力之外的生态兼容、量产可持续性、技术支持等因素,国产芯片凭借政策与市场双驱动,获得广泛应用空间。

海光DCU已实现CUDA核心组件100% API覆盖。

报告数据显示,海光DCU通过DTK软件栈,在runtime、driver API、cublas等核心CUDA组件上达到100%函数功能覆盖率,仅cusparse有15个半精接口因CUDA废弃而未覆盖,其余均完整兼容,大幅降低金融用户迁移成本。

海光DCU支持千卡集群部署,可满足金融大模型多种场景。

报告展示了海光DCU在千卡集群上的落地案例(如BW1000服务器),涵盖132个机柜、800张DCU卡。根据不同模型参数量和输入输出长度,可灵活配置单台8卡或4卡服务器,支撑在线对话、RAG问答、文档生成、复杂分析等任务。

海光DCU深度适配主流AI框架与工具,无需重复学习技术栈。

通过DAS全栈优化组件,海光DCU兼容PyTorch、TensorFlow、JAX等主流框架及FlashAttention、DeepSpeed、vLLM等大模型工具,版本紧跟前沿(如PyTorch 2.5.1),用户可复用现有生态经验,快速试错。

报告回答的关键问题

金融大模型落地需要什么样的算力芯片?

报告认为金融大模型落地需要算力芯片不仅满足标称算力,更需具备完整软件生态、量产可持续性、技术演进支持和用户友好型生态。海光DCU通过兼容CUDA生态、提供DTK/DAS全栈软件、支持千卡集群等方式,满足金融行业从在线对话到复杂文档生成的多样化算力需求。

国产AI芯片如何融入现有CUDA生态?

报告以海光DCU为例,通过DTK软件栈实现CUDA核心组件100% API覆盖,并提供HIP与CUDA双生态兼容的GPUFusion兼容层,使得PyTorch等原生接口无需转换即可直接使用。同时,DAS组件库支持主流AI框架和高版本工具,用户无需改变开发习惯。

海光DCU在金融场景中能达到怎样的性能表现?

报告通过具体业务场景案例说明:在在线通用对话和企业RAG问答中,海光DCU单台8卡可满足并发生成;在文档离线生成及高度复杂场景(如授信报告、财报分析)中,通过参数量与量化平衡及超长上下文优化,吞吐性能可提升5倍甚至10倍(如CodeBuddy场景)。

报告中的代表性数据

91.62亿元(24年)

海光信息营业收入

2024年,报告显示海光信息2024年营收达91.62亿元,2022-2024年年均增长率超过50%,反映国产AI芯片市场快速增长态势。

34.46亿元(24年)

研发投入

2024年,报告指出海光信息2024年研发投入34.46亿元,年均增长率超过20%,研发人员占比90.18%,硕士及以上学历77.61%,体现其对技术创新的高强度投入。

100%(除cusparse半精接口)

CUDA核心组件API覆盖率

报告发布时,报告详细列出DTK对CUDA核心组件(runtime、driver API、cublas等)的函数覆盖率,除cusparse中15个已被CUDA废弃的半精接口外均达100%,表明海光DCU与CUDA生态的高度兼容性。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 金融行业AI发展三阶段详细分析:从被渠道化、自主创新到深化应用,以及各阶段关键驱动力与挑战。
  • 海光DCU技术架构深度解读:包括GPGPU路线、规模量产能力、营收与研发投入数据,比较国产芯片在信创市场中的领先地位。
  • DTK软件栈全面解析:涵盖CUDA核心组件100%API覆盖的详细清单、solver/sparse库覆盖情况,以及多操作系统兼容性(如Kylin、UOS)。
  • DAS全栈优化组件介绍:扩展组件层、框架工具层、基础算子层的具体功能,支持的最新框架与工具版本(如PyTorch 2.5.1、vLLM 0.9.2等)。
  • 千卡集群落地案例完整分析:硬件配置(BW1000服务器)、网络拓扑(IB交换机)、供电与散热方案,支撑金融大模型训练与推理的实际部署经验。
  • 大模型业务场景详细映射:根据模型参数量(7B~671B)和上下文长度(0.5k~64k)对应的硬件配置(1台8卡或4卡),并给出在线对话、RAG、文档生成等性能指标(TTFT、并发、吞吐)。
  • CodeBuddy及ADP原子能力适配案例:Codewise-7B模型10倍性能提升,Embedding、Reranker、OCR等原子能力44.65%性能提升,展示在金融编程自动化、合规质检中的实际效果。
  • 开放生态全景图:海光DCU与操作系统、数据库、中间件、行业应用(金融、能源、交通等)的兼容矩阵,体现其广泛的生态合作与整机适配能力。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告