报告概述

本报告是华为云智果(AgentArts)智能体平台的技术操作手册,聚焦智能体运营运维模块。报告详细介绍了如何通过观测功能实现智能体运行数据的透明化采集与可视化展示,包括调用链追踪、指标监控、会话分析等内容。同时覆盖了智能体评估的两种方式——离线评估与在线评估,指导用户构建评测集、选用评估器并执行评估任务,从而量化智能体输出质量并持续优化。报告还提供了数据上报的三种模式(平台自动上报、高代码集成上报、第三方OpenTelemetry上报),适用于不同开发场景的开发者。

报告的核心结论

智能体运行数据可实现全程可观测

AgentArts平台提供观测功能,通过在请求处理的关键节点插入探针,自动采集处理时间、调用路径等信息,构建完整调用链(Trace),并以可视化界面展示。开发者可以查看业务指标、运营指标、调用链详情、会话分析等,快速定位性能瓶颈与异常节点,实现从“黑箱”到“透明视图”的转变。

评估功能支持离线与在线两种模式

AgentArts评估模块支持离线评估和在线评估。离线评估用于开发阶段,通过预设评测集对智能体进行批量测试,使用预置或自定义评估器打分;在线评估用于生产运维阶段,基于真实Trace数据自动采样并评估,持续监测线上质量。两种模式覆盖智能体全生命周期,帮助开发者量化效果并推动迭代。

数据上报覆盖三种开发方式

AgentArts观测支持三种数据上报模式:平台内创建的智能体自动上报运行数据;本地高代码开发的智能体通过集成SDK托管至平台后上报;第三方智能体(如LangChain框架开发)可通过OpenTelemetry协议上报Trace和Metric数据。三种模式灵活适配不同开发环境,实现统一观测。

预置评估器覆盖多维度质量检测

平台提供超过40种预置评估器,涵盖正确性、幻觉现象、AI味检查、指令遵从度、工具参数正确性、安全性等维度。评估器基于模型判定或代码判定,可灵活组合,满足知识问答、内容安全、工具调用等多种业务场景的评估需求,降低构建评估体系的难度。

报告回答的关键问题

如何查看智能体运行时的调用链数据?

在AgentArts平台左侧导航栏选择“运营运维 > 观测”,进入“调用链分析”页签。该页面展示所有上报的调用链记录,每条包含TraceID、请求状态、响应时间、Tokens等。单击任意记录可查看调用树详情,包括每个Span的输入输出、元数据、指标和日志。支持按应用类型、时间、状态等筛选,帮助快速定位性能瓶颈或异常节点。

怎样对一个智能体进行自动化评估?

首先在“评估任务”页签创建评估任务。离线评估需准备评测集(包含输入和预期输出),选择要评估的智能体版本,再选择合适的评估器(如正确性、幻觉现象等)。任务执行后,系统将自动把评测集数据输入智能体,获取实际输出并与预期输出对比,生成评分和评估报告。在线评估则需配置采样策略,基于线上Trace数据自动触发评估,适用于持续监测。

AgentArts平台支持哪些数据上报方式?

AgentArts观测支持三种数据上报方式:1)平台原生自动上报:在AgentArts平台创建的智能体,发布时开启日志、调用链、指标开关后,系统自动采集API调用产生的数据;2)高代码集成上报:本地开发的智能体托管至平台运行时,开启日志记录开关,运行数据自动上报;3)第三方OpenTelemetry上报:非AgentArts平台开发的智能体,通过观测OpenAPI(遵循OTel协议)上报Trace和Metric数据。

如何创建和使用评测集?

在“评估 > 评测集”页签创建评测集,按业务需求配置列(如input、reference_output等),支持手动录入、批量导入(CSV/XLSX/JSONL)或通过AI智能合成数据。评测集提交后可在离线评估任务中选用。此外,线上Trace数据可通过“添加到评测集”功能回流至评测集,实现评测集的持续迭代。每个评测集最多支持5000条数据,100个评测集。

报告中的代表性数据

1183 Tokens

Tokens消耗

示例数据,业务指标统计中展示的Tokens消耗示例,表示大模型调用过程中消耗的Token总数,含Input和Output。实际值依赖具体调用情况。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 智能体观测功能介绍:详细阐述了观测的背景、核心能力(业务指标、运营指标、调用链分析、会话分析等)以及基础概念(Trace、Span、元数据、标注等),帮助开发者理解如何将智能体运行过程透明化。
  • 数据上报完整操作指南:包括AgentArts平台内智能体自动上报、高代码智能体集成上报、第三方智能体通过OpenTelemetry上报的详细步骤,含代码示例、环境变量配置和常见问题排查。
  • 业务指标与运营指标查看:说明如何查看智能体的关键运行指标(Tokens消耗、响应成功率、模型调用次数等)以及租户级别的运营统计(应用总数、活跃数、消耗排行等),支撑成本优化与资源管理。
  • 调用链分析与会话分析:提供调用链详情页的全方位视图(元数据、标注、指标、日志),以及会话分析功能,支持追溯对话上下文、定位性能瓶颈。
  • 高代码应用运行数据查看:介绍智能体运行时、沙箱工具、网关的日志查看路径,帮助本地开发用户实现运行状态可视化与故障排查。
  • 智能体评估方法论:评测集、评估器、评估任务三要素的详细说明,涵盖离线评估(智能体评估与评测集评估两种模式)和在线评估的应用场景与操作流程。
  • 预置评估器完全列表:列出40+个预置评估器的名称、功能、评分标准、输入输出参数及示例,覆盖正确性、幻觉、安全性、创意性、工具调用等多维度。
  • 评测集管理与AI合成:说明评测集的创建、数据添加(手动/批量/智能合成)、版本发布、导出及历史版本维护,支持利用AI泛化种子数据快速构建高质量测试集。
  • 评估结果分析与回流:指导如何查看评估报告、进行人工标注校准、对比不同版本评估结果,并将评估结果回流至评测集,形成数据持续优化闭环。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告