报告概述

本报告由哈工大计算学部人工智能学院车万翔老师主讲,围绕大模型(大语言模型)的原理、技术与应用展开系统梳理。报告以“从GPT到DeepSeek”为主线,回顾自然语言处理从专家知识到预训练语言模型再到推理范式的六次变迁,详解ChatGPT与DeepSeek系列模型的核心技术,包括无监督学习、指令精调、人类反馈强化学习、思维链、GRPO强化学习框架等。同时报告介绍了大模型在提示工程、检索增强生成、智能体、具身智能等领域的最新应用,并展示了哈工大在对话、代码、医学、精神健康、机器脑等方面的大模型研发成果,为读者理解大模型技术全貌和未来AGI方向提供了系统参考。

报告的核心结论

大语言模型已成为人工智能的基石

报告指出,语言是人类交流思想、表达情感最自然、最深刻的工具,人类大部分知识以语言文字形式记载和流传。自然语言处理属于认知智能,被誉为人工智能皇冠上的明珠。大模型以语言为核心,通过海量预训练涌现出推理能力,正在成为推动人工智能发展和广泛应用的基础设施,制约AI取得更大突破的关键在于语言理解。

DeepSeek-R1仅靠强化学习即可习得推理能力

DeepSeek-R1-Zero在不进行人类监督微调、仅使用基于规则的强化学习(GRPO)的情况下,让模型在训练中自主涌现出反思和自我评估等推理行为,AIME 2024成绩大幅提升,接近OpenAI o1。随后DeepSeek-R1通过冷启动和多阶段训练进一步优化,验证了简单的强化学习算法足以激发大模型的深层推理能力。

极致的模型架构与基础设施优化大幅降低训练成本

DeepSeek通过混合专家模型(MoE)、多头潜在注意力(MLA)、多词元预测(MTP)等算法优化,配合FP8混合精度训练、DualPipe双向流水线调度、跨节点All-All通信等基础设施创新,在保持强大性能的同时显著压缩了训练时间和算力开销,为大规模开源模型的落地提供了工程示范,也改变了行业对训练成本的认知。

自然语言处理正从面向语言转向基于语言的智能

报告认为,大模型使得NLP从单纯理解文本扩展到智能体、具身智能、社会模拟等方向,语言成为通用智能的接口。哈工大研发的活字对话大模型、珠算代码大模型、本草医学大模型以及软硬一体机器脑系统,都体现了这一趋势,即从处理自然语言本身,转变为利用语言作为交互和推理的基础,赋能各类智能化应用。

模型是否以及如何具有创新能力是未来关键问题

报告在总结中提出,DeepSeek-R1已展示了推理能力的涌现,但通往AGI还需拓展语言之外的认知能力。OpenAI将AGI分为聊天机器人、推理者、智能体、创新者和组织者五个阶段,当前大模型主要处于推理和智能体阶段,未来需要探索模型在科学发现、组织协作等更高层次的创新能力,这既是挑战也是重要研究方向。

报告回答的关键问题

为什么自然语言处理是人工智能皇冠上的明珠?

因为自然语言处理属于认知智能,需要让计算机理解、生成自然语言,涉及抽象和推理能力,是人类与动物的主要区别之一。报告引述多位科学家观点指出,自然语言处理是制约人工智能更大突破和更广泛应用的瓶颈,只有让机器真正理解语言,才能推动AI进入更高阶段,因此被誉为“皇冠上的明珠”。

DeepSeek-R1是如何获得推理能力的?

DeepSeek-R1-Zero直接使用基于规则的强化学习(GRPO),只以答案准确率作为奖励,经过数千步训练后,模型自发涌现出反思、自我评估等推理行为。R1进一步加入冷启动数据和多阶段训练,通过监督微调和强化学习的交替优化,提升了推理过程的规范性和泛化能力,最终接近OpenAI o1的水平。

大模型怎样才能更好地遵循人类指令?

报告指出三条关键技术路径:一是通过大规模无监督预训练让模型具备语言理解基础;二是通过指令精调(Instruction Tuning)统一各种任务形式,使模型能够处理未见过的任务;三是通过人类反馈强化学习(RLHF)让模型与人类偏好对齐,从而更安全、更有用地回应用户需求,这也是ChatGPT成功的关键。

RAG和SFT有什么区别,何时使用?

RAG(检索增强生成)适用于模型知识不足或需要引用最新、私有知识的场景,通过外部检索器补充上下文,让模型基于检索到的文档生成答案;SFT(有监督微调)适用于风格不对或需要固定输出格式的场景,用高质量标注数据调整模型行为。报告将二者视为解决大模型领域落地的两种主要手段,可根据知识缺口和风格需求选择。

DeepSeek为什么能以低成本训练出高性能大模型?

DeepSeek之所以能以较低成本训练,是因为它在模型架构上采用混合专家(MoE)、多头潜在注意力(MLA)、多词元预测(MTP)等设计,显著减少计算量;在基础设施上采用FP8混合精度训练、DualPipe双向流水线和高效的跨节点通信,大幅提升了训练效率和硬件利用率,同时通过强化学习等方法提升了模型的推理能力,从而用更少的算力实现高性能。

报告中的代表性数据

约278.8万GPU小时/558万美元

DeepSeek-V3训练成本

2024年12月发布时,报告显示,671B参数(激活37B)的DeepSeek-V3训练成本约为规模更小的Llama-3.1的十分之一,体现了其在模型架构和工程优化上的显著效率优势。

39.2%提升至71.0%

DeepSeek-R1-Zero在AIME 2024的pass@1分数

AIME 2024测试,该成绩在仅使用强化学习、没有人类监督微调的情况下取得,接近OpenAI o1-preview,验证了纯粹强化学习对推理能力的激发效果。

84.4%

哈工大活字1.0安全性指标

活字1.0发布时(材料未明确具体日期),报告指出活字1.0的安全性指标达到84.4%,高于ChatGPT的81.9%,体现其在安全对齐方面的表现。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 自然语言处理发展全景:系统梳理从1950年代小规模专家知识、浅层机器学习、深度学习、预训练语言模型到大模型与推理的六次范式变迁,介绍每个阶段的代表性技术、模型和关键事件,帮助读者建立完整的NLP发展脉络。
  • GPT系列技术演进:详细解析从GPT-1到GPT-3、ChatGPT、GPT-4的迭代过程,涵盖语言模型预训练任务、Transformer架构、少样本学习、指令精调和人类反馈强化学习等核心技术,展示生成式预训练模型如何一步步走向通用。
  • DeepSeek模型深度解析:覆盖DeepSeek-V1到V3、R1-Zero、R1的技术路线对比,包括模型参数规模、训练数据量、训练稳定性、最大参数量等指标,并深入讲解其核心创新,如混合专家架构、多头潜在注意力、多词元预测等。
  • 推理技术核心方法:围绕推理能力实现,详细介绍思维链(CoT)的少样本、零样本变体,DeepSeek-R1-Zero采用的GRPO强化学习框架,以及R1的冷启动、多阶段训练路线,解释推理能力如何被激发和稳定。
  • 大模型应用方法论:整理OpenAI提出的6条提示工程原则,包括清晰指令、参考文本、任务分解、思考时间、外部工具和系统测试,并对比RAG和SFT两种领域适配方案的适用场景,给出实际应用建议。
  • 高效训练工程实践:聚焦DeepSeek降低训练成本的具体技术,包括FP8混合精度训练、DualPipe双向流水线调度、跨节点All-All通信优化等,从算法和基础设施两个层面展示大模型训练效率提升的工程方案。
  • 哈工大大模型研发成果:展示活字对话大模型、珠算代码大模型、巧板与巧环精神健康系统、本草医学大模型、人机融合医疗会诊平台、软硬一体机器脑系统等自主成果,并说明其技术特点和应用场景,体现学术机构在大模型领域的实践能力。
  • 未来AGI路径与展望:从大语言模型出发,讨论通向AGI的五个阶段,分析多模态、具身智能、组织协作等语言之外的能力拓展方向,并展望模型创新能力这一未来关键问题,为研究者提供前沿思考。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告