报告概述
本白皮书聚焦网络与AI深度融合趋势,分析5G QoS体系在适配AI业务时的局限性,提出网络AI服务质量(QoAIS)指标体系。体系采用系统、任务、资源三层架构,围绕连接、计算、数据、模型四大要素设计指标映射规则。同步搭建端到端测试床,支持云端、边缘、端侧三种大模型部署形态,并制定分层测试方案。报告通过大语言模型典型场景实测验证指标体系与测试方案的可行性,旨在为网络AI业务质量评估、资源协同调度提供统一标准,推动6G智能服务产业化。
报告的核心结论
5G QoS体系无法适配AI业务动态特征与核心要素。
传统5G QoS面向稳态比特传输设计,无法匹配AI业务Token流式传输、强突发、高连续性的流量特征,且缺失算力、模型、数据等AI核心要素的度量维度,难以量化用户体验和支撑端边网云全链路管控。
QoAIS体系采用系统、任务、资源三层架构实现需求至资源的映射。
系统级衡量网络整体AI服务供给能力,任务级直接对应用户体验,资源级下沉至连接、计算、数据、模型四类基础要素。三层逐级映射,将用户体验需求转译为网络可理解的资源配置参数。
端侧推理在差信道条件下首Token时延优势显著。
测试表明,在TCL300衰落信道下,端侧轻量化模型平均TTFT为1.53s,边缘部署为2.77s,云端为3.88s。端侧本地推理完全规避空口传输损耗,对无线环境不敏感,是保障实时交互的有效方案。
模型规格增大存在边际效益递减特征。
相同条件下Qwen-Plus(通用复杂模型)平均TTFT为2.84s,Qwen-Flash(轻量化模型)为1.01s,但两者在常规场景下输出能力趋同。应针对业务需求精准选型,避免盲目扩容浪费资源。
多用户并发导致AI服务时延因资源争抢而劣化。
随着并发用户数从10户增至50户,系统TTFT从41ms升至251ms,末Token时延从901ms升至5474ms。需通过容量规划、动态负载均衡和端边云协同调度提升并发承载上限。
报告回答的关键问题
5G QoS体系为何无法满足AI业务服务质量保障?
5G QoS体系面向传统视频、语音等稳态业务设计,带宽、时延等指标无法捕捉AI业务Token流式传输的突发性和连续性;同时缺失算力、模型、数据等度量维度,导致难以量化用户体验和进行全链路根因定位,亟需构建新型指标体系。
QoAIS指标体系如何分层设计?
QoAIS采用系统、任务、资源三层架构。系统级关注全网AI服务密度与能效;任务级聚焦单用户单次AI任务的时延、准确度等体验指标;资源级拆解为连接、计算、数据、模型四类要素的QoS指标,实现从用户体验到底层资源的逐级映射和精准调度。
端侧、边缘、云端三种部署对首Token时延有何影响?
在弱信道条件下,端侧轻量化模型平均首Token时延(TTFT)为1.53s,边缘部署为2.77s,云端为3.88s。端侧推理因无跨网传输,时延优势明显;边缘和云端依赖无线链路,时延受网络质量影响显著。
大模型规格越大是否一定带来更好体验?
不一定。测试表明,Qwen-Plus(复杂模型)与Qwen-Flash(轻量模型)在常规交互场景下输出能力趋同,但复杂模型TTFT更高(2.84s vs 1.01s),资源消耗更大。存在边际效益递减,应场景化选型,平衡体验与成本。
多用户并发场景下如何保障AI服务体验?
高并发时共享资源争抢导致时延剧增(50用户时TTFT较10用户增长6倍)。可通过容量规划设定并发阈值,引入动态负载均衡和优先级调度,并利用端边云分层架构将部分任务下沉至边缘或终端,缓解云端压力。
报告中的代表性数据
不同部署方案首Token时延
测试时未明确,在TCL300衰落信道下,Qwen2-0.5B模型分别部署在终端、边缘服务器和云端时的平均TTFT。
信道波动对TTFT的影响
测试时未明确,边缘部署叠加100ms时延+100ms抖动后,平均TTFT从3.88s增至7.85s,时延接近翻倍。
多用户并发TTFT变化
测试时未明确,云端部署,并发用户数从10增至50时,平均TTFT从41ms升至251ms。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 详细阐述网络与AI融合的演进背景,包括6G典型应用场景、Token级传输、端边网云协同、多模态融合等新特性。
- 系统分析5G QoS体系在适配AI业务时存在的三方面核心局限,论证构建新指标体系的必要性。
- 完整呈现QoAIS三层指标体系设计,包括系统级(AI服务密度、系统能效)、任务级(时延、准确度、安全隐私)、资源级(连接、计算、数据、模型)的详细指标定义与计算公式。
- 端到端测试床整体架构说明,涵盖终端模块、网络仿真模块(CMX500)、AI服务器、数据解析模块,以及云端、边缘、端侧三种部署方案。
- 专项数据采集方法:功耗高精采集、数据集质量解析(数据健康度评分)、模型性能监测(白盒/黑盒测试)的详细方案。
- 核心指标分层测试方案:资源级(连接、计算、模型、数据)单维度隔离测试、任务级端到端综合测试、系统级多用户并发压力测试的具体方法。
- 五大典型测试用例的完整条件、过程与结果分析:偏差无线环境下不同部署方案、信道波动对LLM交互影响、不同模型规格性能、对话上下文影响、多用户并发承载。
- 未来展望与后续工作计划:扩充多模态AI、AI Agent等场景,完善全量指标验证,形成标准化测试规范。
- 缩略语列表与参考文献,包括3GPP、CCSA、罗德与施瓦茨、唯亚威等相关标准与技术资料。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。
相关报告

Agentic AI is here. Is your bank’s frontline team ready?

National AI Plan

AI in human resource management: The limits of empiricism

Accelerating Large-Scale Grid Infrastructure Projects to Win the AI Race

Generative AI and Economic Growth
