AI Agent Skill 测评方案及落地实践(下)

AI Agent  Skill 测评方案及落地实践(下) AI Agent Skill 测评方案及落地实践下本文为《AI Agent Skill 测评方案及落地实践》系列第 3 篇共 3 篇建议连续阅读。五、实战案例TPerf 性能 AI 分析 Agent理论和框架讲了四章读者可能会问实际做起来到底是什么样的本章以 TPerf 性能 AI 分析 Agent 为真实案例从 Agent 特点出发逐步展示如何将前四章的通用方法论落地为一套完整的、可运行的测评实践——包括评分标准的具体化、用例集的实际组织、基线管理的实操流程、以及最终的工程实现和报告效果。[图片TPerf 性能 AI 分析 Agent 测评实践概览]5.1 Agent 概述TPerf AI 分析 Agent 属于「功能工具」类型部署在 Knot 智能体平台上通过 MCP 工具调用 TPerf-API 获取各维度性能数据结合知识库检索进行深度分析经决策树判断资源瓶颈点和压测有效性输出包含排查建议和优化方向的结构化性能分析报告。整体调用链路[图片TPerf AI 分析 Agent 整体调用链路图]①② 用户 ↔ TPerf 平台用户在平台执行性能测试任务获取压测结果③ TPerf 平台 → Agent压测完成后平台自动触发 Agent 进行用例结果分析④ Agent → TPerf 平台Agent 通过 MCP 工具拉取任务的性能压测数据⑤ Agent ↔ 业务知识库Agent 检索业务知识库获取分析规则和排查经验⑥ Agent → TPerf 平台Agent 将分析报告输出到平台展示报告包括压测有效性性能指标结果资源瓶颈点优化排查建议⑦⑧ 用户 ↔ Agent用户查看分析结果也可对话追问或手动指定用例进行分析Agent 返回排查建议⑨ 用户操作根据 Agent 建议进行性能调优测评侧重三个方面操作步骤合规性 执行效率 输出报告质量。5.2 测评设计了解了 Agent 的定位和能力边界后接下来按照第二、三章的通用框架针对 TPerf AI 分析 Agent的业务特点进行具体化设计。评分标准采用确定性评分 模型评分两层组合满分 100 分扣分制沿用第三章 3.2 的通用评分框架。TPerf 将通用方案中的任务结果映射为关键判定压测有效性 性能结果将过程细化为操作步骤将产物质量细化为章节内容逐项对比。确定性评测维度由脚本自动判定维度关注点最大扣分评分方法操作步骤工具调用流程是否与基线一致-10使用 LCS最长公共子序列算法对齐基线与 Trial 的操作步骤步骤不一致/多余/缺少/顺序错误各扣 2 分效率分析耗时和 Token 消耗是否合理-10耗时以 300s 为基准每超标 10% 扣 1 分Token 以基线消耗为基准每超标 10% 扣 1 分稳定性同一任务多次分析结论是否一致—并发 N 次执行全部达标取平均分任一不达标则 0 分见下方说明模型评分维度由 LLM 按 Rubric 判定维度关注点最大扣分评分方法关键判定压测有效性判定有效/无效和性能结果判定通过/不通过是否与基线一致-80任一项不一致直接扣 80 分章节内容CPU/内存/网络/磁盘IO/业务指标/根因定位/优化建议/报告完整性/数据准确性每项 -5上限 -80调用 CodeBuddy CLI 让大模型逐项对比基线报告与 trial 报告一致性判断标准数值型整数精确匹配小数允许相对误差≤ 1%结论型异常等级和关键发现一致如正常/异常/堆积建议型核心排查方向一致即可允许命令参数和措辞差异关于稳定性0 容忍策略的说明第四章 4.3 将辅助分析类的容忍阈值定为 ≤10%。TPerf 虽属辅助分析类但其性能分析结论直接影响后续优化决策和版本发布判断一次错误结论可能导致性能问题漏检上线因此选择了更严格的关键决策类标准——任一 Trial 不达标即判定该用例不通过。团队可根据自身场景的风险等级调整此阈值。综合评分公式单次 Trial: trial_score max(0, 100 步骤扣分 效率扣分 报告扣分) 达标判定: trial_pass (trial_score ≥ T)T 80 用例总分: case_score avg(所有 trial_score) 若全部 trial_pass true 0 若任一 trial_pass false评分示例N3, T80用例Trial 1Trial 2Trial 3全部达标用例总分cpu-01959288全部 ≥ 8091.7cpu-02907593Trial 2 800nic-0110010098全部 ≥ 8099.3disk-01858280全部 ≥ 8082.3tcp-01807985Trial 2 800用例集设计明确了评分标准后接下来看用例集如何组织。TPerf AI 分析 Agent 的用例集按性能瓶颈场景分组覆盖 9 大类共 30 个用例每个用例对应一个真实的 TPerf 压测记录。每个用例支持多模型对比评测7 个模型每个用例 × 每个模型生成独立的参数化测试。用例场景覆盖场景分组用例数典型场景CPU 瓶颈6中断绑核异常单核/双核/多核高负载、RSS 哈希配置异常、大象流网卡瓶颈5RSS 队列收包不均CPU 高/低负载、大象流、网卡硬件丢包磁盘瓶颈4磁盘繁忙 IO Util 80%CPU 高/低负载、await 10ms磁盘 IO2磁盘 IO 高负载 iowait 高单核/多核内存1内存占用率 85%TCP 队列3Accept 队列溢出、CPU 高负载导致 accept 不及时Nginx1Nginx 代码问题导致核间不均衡配置问题1压测配置问题导致压力不足正常场景5全核高负载但无异常、RSS 均衡、无丢包、内存正常等用例定义示例每个用例包含以下信息用例名称和描述标识场景和预期异常压测记录 ID对应真实的 TPerf 压测数据触发提示词发送给 Agent 的分析指令基线会话标识指向人工确认正确的一次分析结果session_id message_idtask_group: test_cpu task_group_alias: 测试CPU相关指标异常情况下的分析 tasks: - task_name: test_cpu_nic_queue_interrupt_bindcore_error_single_core_high_load task_desc: CPU瓶颈-网卡队列中断绑核配置异常-单核高负载、si占用高、RSS队列收包均衡 tperf_test_record_id: 1258797 prompt: 分析用例{tperf_test_record_id} base_line_trial: message_id: 269806ca2dd04e259b042345cf7fc313 session_id: 66254b2c49794713b02cbecd425ebf09说明用例中不硬编码任何预期输出而是通过基线会话标识指向一次人工确认正确的 Agent 分析记录评分时从 Knot API 动态获取基线数据作为参照。模型列表、超时、回归次数等参数由全局配置统一管理。5.3 基线管理评分标准和用例集确定后还需要为每个用例建立正确答案——即基线。按照第三章 3.3 的通用基线方法TPerf 的具体实现如下。由于 TPerf AI 分析 Agent 部署在 Knot 平台上基线以 Knot 会话标识的形式保存评测时通过 API 动态获取完整数据。基线建立流程[图片TPerf 基线建立流程图]基线建立核心步骤触发分析向 Knot Agent 发送分析用例{记录ID}触发一次完整分析获取标识记录本次分析的 session_id 和 message_id人工审核在流水线平台查看分析报告确认步骤结论正确、建议合理记录基线将确认通过的会话标识写入用例配置运行时获取评测执行时通过 Knot API 实时获取基线的完整数据报告、步骤、耗时、token基线快照内容评测执行时从 Knot API 动态采集基线数据包含类别内容分析报告完整的 Markdown 格式性能分析报告操作步骤工具调用流程工具名 简化参数 调用顺序执行耗时基线执行总耗时秒Token 消耗输入/输出/总 token 数基线数据运行时从 API 动态获取确保始终对应真实的 Agent 执行结果。采集后落盘保存供后续对比使用。基线更新与用例维护在第三章 3.3 通用基线更新时机Agent 逻辑变更/模型升级/用例修改的基础上TPerf 细化为以下具体场景场景操作Agent 逻辑变更重新执行 1 次人工确认后更新基线会话标识Agent 外部依赖变更重新执行 1 次并确认新基线模型版本升级重新执行 1 次并确认新基线新增 Agent 用例针对新增用例执行 1 次确认后记录基线新增 Bad Case获取压测记录 ID执行 1 次确认后记录基线纳入对应场景分组新增分析能力新建对应场景的用例分组新增覆盖用例5.4 测评执行评分标准、用例集、基线三件套就绪后进入实际执行阶段。TPerf 的测评执行充分利用了并发能力——多个 Trial 并行触发 Agent、Trial 评分并行、三个评分器并行打分——以在可接受的时间内完成大规模多模型对比测评。执行流程单用例执行流程[图片单用例执行流程图]单个 Trial 执行流程[图片单个 Trial 执行流程图]评分机制操作步骤评分— 确定性评分最多扣 10 分使用最长公共子序列LCS算法对齐基线与 Trial 的操作步骤序列。对齐前会对步骤进行归一化处理时间戳替换为占位符、搜索工具忽略查询参数、写入工具忽略文件内容只保留路径、终端命令提取脚本名忽略环境配置、连续读文件操作组内不校验顺序。对齐后步骤不一致/多余/缺少/顺序错误各扣 2 分。效率评分— 确定性评分最多扣 10 分耗时以全局配置的基准时间300s为参照每超标 10% 扣 1 分Token 消耗以基线 Token 数为参照每超标 10% 扣 1 分。两项合计最多扣 10 分。报告评分— 模型评分最多扣 80 分将基线报告和 Trial 报告写入文件生成评分 Prompt调用 CodeBuddy CLI 让大模型逐项对比两份报告。评分完成后校验结果格式合法性。关键判定压测有效性/性能结果不一致直接扣 80 分章节内容CPU/内存/网络/磁盘IO/业务指标/根因/优化建议/完整性/准确性/结论每项差异扣 5 分上限 80 分。执行模式模式说明适用场景快速分析每用例跑 1 轮生成可视化报告日常开发调试、确定基线全量测评每用例跑 5 轮 × 7 模型评估稳定性版本验收、模型对比按模型筛选只运行指定模型的用例单模型验证重新评分对已有执行结果重新评分评分逻辑调整后无需重新触发 Agent触发时机在通用触发时机见第三章 3.4基础上TPerf 增加了工具更新的触发条件场景触发方式说明TPerf AI 分析 Agent 提示词变更CI 流水线自动触发PR 合入前回归验证TPerf 分析相关工具更新CI 流水线自动触发验证工具变更未破坏分析能力模型版本升级手动触发验证新模型兼容性定期巡检定时触发周期性全量回归5.5 工程实现前面介绍了评什么和怎么跑本节展开工程实现细节——Trace 如何获取、项目如何组织、流水线如何集成。Trace 获取TPerf AI 分析 Agent 部署在Knot 智能体平台上通过 Knot 的 AG-UI 协议进行交互。采用Knot API 查询方式触发 Agent 分析后通过轮询等待数据库同步完成然后获取完整的 AG-UI 事件流。该事件流包含工具调用事件记录每次工具调用的名称、参数和返回结果文本消息事件Agent 生成的 Markdown 分析报告分段拼接时间和消耗请求时间、完成时间计算耗时、Token 消耗明细最终分析报告从文本事件拼接后以性能用例分析报告标记截取事件流解析器跟踪工具调用的开始→参数→结果事件构建完整的调用步骤列表。对参数进行简化处理终端命令提取关键信息、读文件提取路径、MCP 工具提取核心参数、写入类工具截断内容使步骤对比更加合理。框架结构测试场景基于真实的 TPerf 压测记录不使用 mock 数据。压测记录一旦生成即不可变确保用例可复现。项目按职责分层组织层级说明API 封装层封装 Knot 智能体 API 和 TPerf 平台 API配置层全局配置模型/超时/评分标准、凭证配置、模型定价配置用例定义层按场景分组的 YAML 用例文件9 个分组采集层基线数据采集器从 Knot API 获取基线的报告、步骤、耗时、Token评分层三个独立评分器操作步骤评分、效率评分、报告评分执行层用例执行器触发 Agent、收集结果、编排评分流程工具层快速评测脚本、报告生成器、重新评分工具、基线同步工具解析层AG-UI 事件流解析器将原始事件流转换为结构化的工具调用步骤列表结果层基线落盘、评分结果、中间文件、HTML 报告框架启动时递归扫描所有用例配置文件结合全局模型列表为每个用例 × 每个模型生成独立的参数化测试。支持通过 pytest marker 按模型筛选用例。流水线集成与报告根据执行模式的不同分为两条流水线基线确认流水线用于日常开发调试和快速验证确定基线[图片基线确认流水线示意]环节说明执行方式指定用例 ID 列表 或 全量用例支持指定并发数和模型执行环境Python 3.10、Knot 凭证、网络可达 Knot API报告格式左右分栏左侧用例列表支持搜索/筛选 右侧 Markdown 渲染成本计算根据模型定价配置计算每次分析的 token 费用报告效果基线确认报告示例左侧为用例列表显示用例耗时/Token/费用明细/会话信息支持搜索和折叠右侧为选中用例的详情包含用例基本信息、分析报告结果。[图片基线确认报告示例]测评流水线基线确认后进入正式测评环节采用pytest 实现全部测评逻辑用例管理复用 TCase 平台[图片测评流水线示意]环节说明用例管理用例上传至 TCase 平台创建用例集和任务并发策略Trial 执行并发 Trial 评分并行 三个评分器并行重试机制遇限流/模型异常自动等待重试最多 5 次数据获取轮询等待同步超时设置单用例约 3000s全量 30 用例 × 7 模型约 3-5 小时报告展示测试结束后自动生成 HTML 报告在流水线中展示过程归档评分结果、基线数据、Agent 响应等过程文件归档至流水线产物测评完成后自动生成 HTML 报告全量测评报告包含顶部汇总总用例数、通过/失败数、通过率、模型版本、执行时间分组展示按场景分组每组显示用例列表单用例详情展开后显示每次 Trial 的三维度评分明细步骤对比 耗时/Token 对比 报告对比 综合得分回归评分显示稳定性达标情况和最终分数Knot 对话链接每个 Trial 提供 Knot 平台对话历史的跳转链接成本统计显示每次评测的 token 消耗和费用全量测评报告总览顶部显示通过率、平均分、模型版本、总 Token、总费用等全局汇总指标左侧按场景分组展示全部用例及得分和分数分布直方图右侧展示该用例执行的详细信息。[图片全量测评报告总览示例]单用例评分详情展示该用例的基线信息耗时/Token/费用/步骤数、Prompt、多次 Trial 的逐项评分Transcript 扣分、效率扣分、结果扣分及最终稳定性评分。[图片单用例评分详情示例]Trial 对话详情展示单次 Trial 的完整对话 ID、Token 消耗、费用、耗时以及 Transcript 各维度评分的扣分明细和上限支持跳转至 Knot 平台查看完整对话历史。[图片Trial 对话详情示例]模型对比报告横向对比多个模型在全量用例集上的综合表现帮助团队做出模型选型决策。模型pass1pass^5用例通过率跑5次得分Token 使用量/M开销/$耗时/smodel-A9x.x%9x.x%9x.x%9x.x0.xx.x2xxmodel-B9x.x%7x.x%9x.x%8x.x0.xx.x2xxmodel-C9x.x%7x.x%8x.x%7x.x0.xx.x2xxmodel-D9x.x%8x.x%9x.x%8x.x0.xx.x2xxmodel-E4x.x%x.x%x.x%x.x0.xx.x2xxmodel-F6x.x%1x.x%2x.x%2x.x0.xx.x1xxpass1跑一次评分达标的概率pass^5连续跑 5 次评分达标的概率开销 Token 使用量 × 模型单价单价使用对外售卖价耗时受模型部署资源影响过程日志与归档每次测评执行产生的所有中间数据和最终报告均按以下方式归档确保可追溯内容说明归档方式基线数据从 API 采集的报告、步骤、耗时、token 完整数据流水线产物基线/Trial 报告用于报告评分的 Markdown 文件流水线产物评分结果各评分器的逐项对比详情和分数流水线产物用例综合评分包含基线、所有 trial、回归评分和最终得分流水线产物HTML 测评报告可视化报告流水线展示基线配置用例中的基线会话标识代码仓库Git 追溯用例执行日志TCase 管理的执行日志TCase 平台查看关键设计基线配置随代码仓库版本化管理变更可通过 Git 追溯执行结果每次执行重新生成通过流水线归档保留重新评分可对已有结果重新评分无需重新触发 Agent 执行六、参考文档本文的方法论和实践经验参考了以下来自 OpenAI 和 Anthropic 的一手资料推荐进一步阅读来源标题链接AnthropicDemystifying evals for AI agentshttps://www.anthropic.com/engineering/demystifying-evals-for-ai-agentsAnthropicEvaluating AI agents: Best practices for reliable measurementhttps://www.anthropic.com/engineering/evaluating-ai-agentsOpenAIEval skills: Build better AI applications through evaluationhttps://developers.openai.com/blog/eval-skills附录术语速查表术语全称含义Prompt—提示词发送给 AI 模型的指令文本Token—词元模型处理文本的最小单位约 0.7 个中文字或 0.75 个英文单词API 按 Token 数计费Trace—执行轨迹Agent 执行过程中产生的结构化日志工具调用、参数、返回值、思考过程EvalEvaluation评估/测评对 Agent 输出质量的系统化评测Rubric—评分量表这里特指用结构化提示词让大模型充当评委打分的方式CoTChain of Thought思维链模型逐步推理的中间过程passk—k 次试验中至少 1 次通过的概率衡量峰值能力pass^k—k 次试验中每次都通过的概率衡量稳定性MCPModel Context Protocol模型上下文协议让 AI 标准化调用外部工具和数据源的开放协议AG-UIAgent-UI ProtocolAgent 与前端界面之间通信格式的标准协议LCSLongest Common Subsequence最长公共子序列一种序列比对算法幻觉Hallucination模型编造不存在的事实、数据或 APIRed Team—红队测试模拟攻击者角色寻找系统漏洞的安全测试方法Prompt Injection—提示词注入通过恶意构造的输入试图劫持 Agent 行为PIIPersonally Identifiable Information个人可识别信息姓名、手机号、身份证号等Ground Truth—黄金标准答案经人工确认的正确参考结果CSATCustomer Satisfaction Score客户满意度评分NPSNet Promoter Score净推荐值衡量用户推荐意愿的指标CIContinuous Integration持续集成代码合入时自动运行构建和测试的流程Trial—单次试验即对同一用例的一次独立执行