报告概述

本报告聚焦于大规模推理时代AI基础设施的可观测挑战与实践,由阿里云多位技术专家联合撰写。报告首先剖析了大模型推理、AI Agent不确定性工作模式以及IT架构快速重构带来的新挑战,随后系统介绍了阿里云从IaaS到MaaS的全栈AI可观测架构,包括GPU监控、容器集群可观测、PAI平台可观测及模型服务百炼可观测方案。报告深入探讨了可观测数据建模UModel的设计与应用,并分享了基于智能体(Agent)的SRE智能巡检与根因定位实践。此外,报告还涵盖了Agent全链路观测体系、离线评测体系以及基于评估工程的迭代飞轮,为读者提供从理论到工程落地的完整参考。读者可通过本报告了解如何在复杂云原生环境中构建高效、智能的可观测体系,提升AI基础设施的稳定性和运维效率。

报告的核心结论

AI基础设施可观测面临黑盒模型与不确定工作模式的新挑战

报告指出,模型推理过程已超越人类直觉,需从统计上感知性能和准确性;AI Agent的不确定性工作模式使得传统日志、指标难以评估其状态,需要Trace等更精细的可观测手段。同时,Infra算力高速增长导致可观测数据指数级增长,IT架构快速重构也对稳定性带来巨大挑战。

统一数据模型UModel是AIOps规模化落地的关键底座

报告认为,运维数据高度碎片化,指标、日志、链路等分散在不同系统,缺少统一语义。UModel通过定义实体、指标集、日志集等,将云原生环境中的数据、知识和行动放到同一套模型里,为AIOps Agent和Benchmark提供可复用的基础,打破数据孤岛。

大规模模型与轻量算子的协同是平衡效果与成本的有效路径

报告提出,大模型负责理解自然语言问题、规划分析步骤,而具体的数据计算(如时序分析、异常检测)由小模型或算法算子完成。通过计算下推,大量原始数据先转化为结构化特征和结论,可综合降低Token消耗90%以上,实现效果与成本的最优平衡。

基于Benchmark的标准化评测推动AIOps从Demo走向工程化落地

报告指出,当前AIOps多停留在单点Demo,缺乏可对比、可复现的评测体系。阿里云构建了包含拓扑感知、深度洞察、辅助决策等维度的AIOps Benchmark典型问题库,并依托持续演化支撑环境,使算法和Agent有统一的度量,每次升级都可通过评测验证效果。

Agent全链路观测与离线评测体系构成Agent迭代飞轮

报告强调,Agent的优化依赖线上真实数据。通过全链路Trace/Log/Metric采集实现执行过程透明化,结合离线评测体系在CI/CD流水线中设置质量门禁,再通过线上评估引擎持续发现Badcase,形成“观测-评估-优化”的闭环,推动Agent持续进化。

报告回答的关键问题

大规模推理时代,AI基础设施面临哪些新的可观测挑战?

报告指出,挑战主要包括:模型推理的黑盒性,需要从统计上感知性能和准确性;AI Agent的不确定性工作模式,使得传统监控失效;高速增长的Infra算力规模导致可观测数据指数级增长;以及AI Coding等新技术带来的IT架构快速重构对稳定性造成巨大冲击。

阿里云如何构建全栈AI可观测架构?

阿里云从IaaS到MaaS构建全栈AI可观测架构:IaaS层通过GPU监控、即时巡检、诊断等覆盖GPU算力芯片可观测;CaaS层基于ACK灵骏集群和AI套件提供容器和异构资源可观测;PaaS层通过PAI平台实现ML全流程可观测;MaaS层对百炼模型服务进行Trace、日志和监控,形成端到端的可观测能力。

UModel统一数据模型如何解决运维数据碎片化问题?

UModel将日志、指标、链路、拓扑、变更等数据统一到同一套语义与格式,定义实体(如应用、Pod、数据库)及其关系,以及挂载在实体上的观测数据(指标集、日志集等)。这样,运维人员或AIOps Agent可以基于统一的世界模型进行故障诊断、影响分析,而无需在多个系统间手工关联数据。

如何利用Agent实现智能巡检与根因定位?

阿里云构建了SRE Agent,基于Tool Base架构,结合UModel加持的可观测数据分析、外挂式Sandbox执行运维指令、预置云产品巡检Skill等。Agent能够自动执行容器集群巡检,发现异常后通过长程任务管理进行根因定位,并通过IM发送简洁报告。同时,通过故障注入和自动化评估形成闭环迭代。

AIOps Agent的效果如何衡量和持续优化?

报告提出基于可观测+评估的Agent迭代飞轮:全链路观测采集Trace数据,离线评测体系在发布前设置质量门禁,线上评估引擎实时监控并挖掘Badcase。通过建立标准化Benchmark(如拓扑感知、深度洞察、辅助决策等维度的题库),每次Agent升级都需通过评测,实现效果可衡量、可对比,并持续通过数据回流优化Agent。

报告中的代表性数据

87.5%

万卡集群运维效率提升

未明确,阿里云GPU Profiling帮助业务提升万卡集群运维效率87.5%,每月每张卡无效运行时间从8小时优化至1小时,能解决掉20%的问题。

70万卡时/月

减少无效训练卡时

月,按50万卡GPU规模,通过优化每月减少无效训练卡时70万卡时,按每卡时约100元计算,节省约7000万元/月。

3倍

突发性任务资源利用率提升

未明确,报告在介绍云原生AI应用案例时提到,基于容器服务,突发性任务资源利用率提升3倍,综合计算成本降低45%。数据取自客户公司内部生产环境实测。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 全栈AI可观测架构详解:深入介绍从IaaS(灵骏智算服务)、CaaS(ACK灵骏集群+AI套件)、PaaS(PAI平台)到MaaS(模型服务百炼)各层的可观测方案设计,包括GPU监控、多租集群方案、Prometheus多租方案等。
  • UModel可观测数据建模实践:详细阐述UModel的设计理念、核心概念(EntitySet、LogSet、MetricSet、TraceSet等),以及如何通过UModel实现大规模Bench Job诊断的可观测本体建模。
  • SRE Agent的设计与实现:展示Tool Base Agent的架构,包括UModel加持的数据分析、外挂式Sandbox、差异化授权、开箱即用Skill、长程任务执行等模块,以及IM人机交互的一等公民设计。
  • Agent自动化评估与闭环迭代模式:介绍如何通过Agent驱动故障注入、自动化巡检诊断、流程评估,并基于评估结果驱动Agent优化、数据建模迭代和Skill提示词工程,形成持续改进的闭环。
  • 容器集群智能巡检与故障根因定位案例:详细演示基于长程任务管理的容器集群巡检流程,包括如何通过IM发送简洁版诊断报告,以及具体故障场景的根因定位方法。
  • Agent全链路观测体系:基于OpenTelemetry标准的Agent全链路可观测方案,涵盖Trace、Metrics、Logs采集,GENAI语义对齐,以及性能分析、安全审计、成本分析等应用层能力。
  • 离线评测体系与仿真环境:介绍如何构建Agent评测集,包括场景覆盖、环境可复现性、动态更新机制;仿真环境(沙箱)确保Action确定性;多种评估器(Code评估、LLM评估)及CI/CD质量门禁实践。
  • 可观测+评估的迭代飞轮实践:以AIOps Agent为例,展示如何将线上Trace数据回流、离线评测、全链路观测有机结合,实现Agent效果的持续提升,包括基于AB实验的上下文调优、基于Trace构建长期记忆等案例。
  • AIOps Benchmark标准化评测体系:阐述阿里云构建的工业级持续演化支撑环境,涵盖拓扑感知、深度洞察、辅助决策等典型问题库,以及围绕“检测-定位-行动-验证”的完整评测指标体系。
  • LoongSuite无侵入AI可观测套件:介绍基于OpenTelemetry的零代码注入可观测方案,支持Python、Java、Go等多语言,覆盖主流AI框架和组件,以及推理引擎(如Qwen)的可观测探索。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告