AI Agent 工程实践(33):Agent 如何监控

发布时间:2026/8/28 6:38:52

AI Agent 工程实践(33):Agent 如何监控
摘要本文针对 AI Agent 上线后“服务活着却在胡说”的监控盲区梳理了只看存活、只看成本、不盯幻觉三种常见错误提出 Agent 监控应在传统指标之外额外关注成功率、Tool Error、Latency、Cost、Token、Memory Hit、Hallucination 七个 LLM 专属维度并给出七指标看板、Mermaid 架构图、Prometheus 打点与离线 eval 示例最后按“可用性必告警、质量类观察为主”的分级原则避免告警疲劳。系列AI Agent 工程实践上一篇第 32 篇《Agent 如何上线》下一篇第 34 篇《企业 AI Agent 架构》一、开场agent 变傻了没人知道运营说最近 agent 答得不对。工程师去查发现三天前某个模型版本更新后特定问题开始胡说。但因为没有监控谁也说不清是哪天开始的哪个场景哪个模型影响多少用户只能靠用户投诉反推。上篇32讲安全上线这篇讲上线后怎么知道它好不好——监控。二、问题背景传统监控不够只看服务存活# 健康检查只返回 200 app.get(/health) def health(): return {status: ok} # 服务活着 ≠ agent 答得好Agent 挂了HTTP 500你会知道但它活着却在胡说传统监控毫无感知。Agent 监控 传统指标 LLM 专属指标。三、错误尝试三种监控盲区错误 1只看 CPU/内存/存活服务没崩就以为没事质量劣化完全盲区。等到发现已经是大量错误回答被用户看见了。错误 2只看成本成本没超就安心但成本和质量是两个轴——可能又贵又烂省钱但答非所问。错误 3不盯幻觉LLM 偶尔胡说正常不量化幻觉率等到客诉才暴露信誉损失已发生。四、关键观察Agent 要盯七个指标传统服务的指标QPS、错误率、延迟只是底座。Agent 额外要盯7 个 LLM 维度成功率请求完整跑完、未异常中断的比例。Tool Error工具调用失败率——Agent 最常见的硬错误。Latency端到端延迟P50/P95——用户体感。Cost单请求成本 日/月总成本趋势。Token输入/输出 token 消耗成本与上下文膨胀的前兆。Memory Hit记忆命中率——命中低说明记不住用户体验差。Hallucination幻觉率——靠 eval 集 用户反馈打分量化。前 5 个可直接打点后 2 个要靠埋点 评估 反馈间接度量。缺任何一个你对系统的认知就有盲区。五、最终方案七指标看板指标定义为什么必须看异常信号成功率未异常中断的请求占比系统基本可用性突降Tool Error工具调用失败次数/总调用Agent 主要硬错误源持续 2%LatencyP50/P95 端到端耗时用户体感P95 翻倍Cost单请求 周期总成本烧钱速度日均超预算Token输入输出 token 量上下文膨胀/成本前兆陡增Memory Hit命中长期记忆比例是否记住用户持续偏低Hallucination幻觉回答占比质量底线上升监控数据流向Agent 运行时打点 → 日志/链路收集 → 指标聚合 → 看板 告警。六、架构图Mermaid七、代码与配置示例用计数器打点伪 Prometheusfrom prometheus_client import Counter, Histogram REQ Counter(agent_requests_total, 总请求) TOOL_ERR Counter(agent_tool_errors_total, 工具失败) LAT Histogram(agent_latency_seconds, 端到端延迟) LAT.time() def handle(req): REQ.inc() try: return run_agent(req) except ToolError: TOOL_ERR.inc() # 工具失败单独计数 raise幻觉率靠离线 eval# 每日跑 eval 集统计答非所问比例 bad sum(1 for c in eval_set if not is_correct(c)) hallucination_rate bad / len(eval_set) # 趋势监控八、设计权衡告警 vs 观察指标建议理由成功率/Tool Error必告警直接影响可用Latency P95告警体感硬指标Cost/Token观察预算线趋势性不必秒级Memory Hit观察体验指标Hallucination周级观察需 eval滞后反过度告警什么都告警 告警疲劳真正异常被淹没。分级——可用性必告警质量类观察为主。把告警留给不处理就出事的指标。九、总结✅ 服务活着 ≠ agent 答得好传统监控对质量劣化盲区。✅ 三种盲区只看存活、只看成本、不盯幻觉。✅ Agent 监控 传统指标 7 个 LLM 维度成功率/Tool Error/Latency/Cost/Token/Memory Hit/Hallucination。✅ 前 5 直接打点后 2 靠 eval 用户反馈间接度量。✅ 分级可用性必告警质量类观察为主防告警疲劳。下一篇把前面所有零件画成一张企业全链路图。34参考资料带用途说明本系列32Agent 如何上线本文监控指标是32灰度/全量判断的依据。本系列27日志系统监控的打点数据来自27的日志字段设计。本系列28可观测性Trace/Span 是本文链路追踪的理论基础。本系列30Agent 如何做测试幻觉率评估复用30的 Golden Dataset。Prometheus 文档prometheus.io指标打点与聚合的实现参考。本文是 AI Agent 工程实践系列的第 33 篇第四阶段第十三篇。系列导航上一篇第 32 篇《Agent 如何上线》下一篇第 34 篇《企业 AI Agent 架构》

相关新闻

工程勘察劳务资质申报要点与常见驳回原因分析

工程勘察劳务资质申报要点与常见驳回原因分析

2026/8/28 6:38:52

工程勘察劳务资质是工程勘察资质体系中的重要组成部分,包括工程钻探和凿井两个分项,不分等级。取得该资质的企业可承担相应的工程钻探、凿井等工程勘察劳务业务,是岩土工程、地质勘察等领域企业的基础准入资质。本文将系统梳理工程勘察劳务资…

小白程序员转行网络安全:收藏这份实用指南,开启高薪之路!

小白程序员转行网络安全:收藏这份实用指南,开启高薪之路!

2026/8/28 6:38:52

小白程序员转行网络安全:收藏这份实用指南,开启高薪之路! 本文为想转行网络安全的读者提供实用建议,涵盖行业概况、学习路径、入门建议、就业情况及转行策略。文章强调网络安全的重要性与挑战,推荐通过自学、报班或实…

小白必看!0基础3个月掌握漏洞挖掘实战,拒绝网安割韭菜,速收藏!

小白必看!0基础3个月掌握漏洞挖掘实战,拒绝网安割韭菜,速收藏!

2026/8/28 6:38:52

小白必看!0基础3个月掌握漏洞挖掘实战,拒绝网安割韭菜,速收藏! 本文提供了一套完整的漏洞挖掘实战路线,帮助0基础学习者掌握网络安全的技能。首先强调计算机网络、操作系统、数据库等核心知识的重要性,然后…

美赛LaTeX备赛指南:环境搭建、模板定制与高效写作实战

美赛LaTeX备赛指南:环境搭建、模板定制与高效写作实战

2026/8/28 7:48:55

1. 项目概述:为什么美赛备赛绕不开LaTeX?如果你正在为2022年的美国大学生数学建模竞赛(MCM/ICM)做准备,并且还在纠结是用Word还是LaTeX来写最终论文,那我以一个过来人的身份告诉你,尽早投入LaTe…

ESP32-P4离线运行180.9M参数LLM与Agent推理实战解析

ESP32-P4离线运行180.9M参数LLM与Agent推理实战解析

2026/8/28 7:48:55

在嵌入式开发圈子里,把 180.9M 参数的 LLM 和 Agent 推理完整放到一块 ESP32-P4 上离线运行,是一个很能说明问题的事情。它意味着模型不再依赖云端 API,不需要网络连接,也能在终端设备上完成文本生成和工具调用。这类能力对智能家…

AI模型测试中越轨现象解读:安全评估体系漏洞与工程化应对

AI模型测试中越轨现象解读:安全评估体系漏洞与工程化应对

2026/8/28 7:48:55

最近几天,AI 圈讨论热度最高的话题之一,不是新模型又刷了多少分,而是一则听起来有些“科幻惊悚”的消息——多个 AI 模型在内部测试中出现了类似“越轨”(going rogue)的行为。所谓“越轨”,并不是模型自己…

YOLOv26-CoordAtt 道路积水检测全链路工程实战|2699 张 VOCYOLO 双标注数据集从训练到城市防汛落地

YOLOv26-CoordAtt 道路积水检测全链路工程实战|2699 张 VOCYOLO 双标注数据集从训练到城市防汛落地

2026/8/28 7:48:55

目录 一、研究背景与行业应用需求 二、道路积水数据集完整基础信息与检测难点 2.1 数据集基础参数 2.2 路面积水四大固有识别难点 三、YOLOv26-CoordAtt 模型架构与标准化训练配置 3.1 改进模型适配积水场景核心优势 3.2 完整标准化训练参数 3.2.1 硬件与尺度基础配置 …

防盗链-技术笔记

防盗链-技术笔记

2026/8/28 7:48:55

什么是防盗链 防盗链其实就是采用服务器端编程,通过url过滤技术实现的防止盗链的软件。 比如: 这个下载地址,如果没有装防盗链,别人就能轻而易举的在他的网站上引用这个地址。 如果对photo.abc.com 这个站的服务器端编程&#xff…

Luma Dream Lab实战:AI生成3D场景,重塑创意方案验证流程

Luma Dream Lab实战:AI生成3D场景,重塑创意方案验证流程

2026/8/28 7:38:55

如果你是一名概念设计师、游戏预制作成员、影视分镜师、广告提案策划,或者只是做产品 Demo 和内容社区运营,那么大概率会遇到下面这个场景:客户或老板说“我想要一个这样的氛围”,而你只能找参考图、画草图、摆 Blocking&#xff…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/27 11:10:02

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/27 7:25:23

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/28 7:34:42

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

基于Claude Code的开源AI求职框架:从职位搜索到Offer的全自动化闭环

基于Claude Code的开源AI求职框架:从职位搜索到Offer的全自动化闭环

2026/8/28 0:08:32

当AI助手能够独立完成从职位匹配、简历定制到面试准备的全链路求职流程时,求职不再是一场信息战,而是一场工程化战役。框架概述:本地运行的AI求职引擎这是一个构建在Claude Code之上的开源AI求职框架,核心理念是"在工作者的机…

Godot 4 仿 agar.io:相机缩放被 max_zoom 卡死,窗口越大球越小的根因与修复

Godot 4 仿 agar.io:相机缩放被 max_zoom 卡死,窗口越大球越小的根因与修复

2026/8/28 0:08:32

1. 问题现象 在 Godot 4 仿 agar.io 的 2D 项目中,相机缩放设计为「由球组整体尺寸决定」,世界可见高度恒定,窗口只作为视口裁剪。默认小窗口 1280x720 时相机高度正常;但窗口最大化到 2940x1912 后,视角被明显拉远、…

从软件测试大赛到实战:Java+Selenium自动化测试进阶指南

从软件测试大赛到实战:Java+Selenium自动化测试进阶指南

2026/8/28 0:08:32

1. 缘起:从校园到赛场,我的软件测试之路几年前,我还是一个在校园里对着Java课本和“Hello World”程序挠头的普通学生。软件测试对我来说,只是一个在开发流程末尾、用鼠标点点按钮的模糊概念。直到我偶然在学校的公告栏上看到了“…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/28 7:35:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/28 7:34:51

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/28 7:34:35

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…