跳转到内容

评测Agent的流程分析 ​

系列:开源模型评测

来源公众号:智能大时代

发布时间:2026-09-01 22:14

原文链接:阅读公众号原文

本篇以 Harbor框架 为例分析一下 Agent 评测的流程。其他的 Agent 评估框架结构和流程类似。

Agent 评测有助于评价企业 Agent 是否安全、稳定运行,同时,有利于为企业降低 token 成本。

当前,企业 Agent 已经开始大量上生产,但 evaluation engineering 明显落后于 observability 和 Agent development,为企业构建评测架构变得非常重要。

Harbor 框架是当前主流的 Agent 评测框架,是 Terminal-Bench 2.0 的官方评测设施,也支持 SWE 等任务的评测,此外,workbuddy-bench 也是基于 Harbor 构建的。更多介绍:Harbor 介绍:面向 Agent 评测的基础设施

Harbor 的典型流程可以概括为:

确定评测场景     ↓ 设计 Task     ↓ 构建 Environment     ↓ 编写 Verifier     ↓ Oracle 验证     ↓ 多个 Tasks 组织成 Dataset     ↓ 接入 Agent / Model     ↓ 运行 Job     ↓ 分析结果     ↓ 优化模型或 Agent

还可以将 Harbor 产生的 Trajectory 和 Reward 收集起来,用于 SFT、Preference Training 或 RL,提升模型能力。

创建 Task ​

Harbor 中最基本的评测单位是 Task。

可以通过 CLI 初始化:

harbor task init office-calendar-001

典型 Task 包含:

office-calendar-001/ ├── instruction.md ├── task.toml ├── environment/ ├── solution/ └── tests/

其中:

  • • instruction.md 描述 Agent 需要完成的任务;

  • • environment/ 定义执行环境和初始数据;

  • • tests/ 定义 Verifier;

  • • solution/ 保存标准解法,即 Oracle Solution;

  • • task.toml 配置超时、网络、资源等参数。

例如在办公领域,一个企业办公任务可以是:

Alice 无法参加周五下午的会议。 请读取她最新的邮件,找到双方都有空的时间, 重新安排会议并通知 Alice。

对应的 Environment 可以包含邮件、日历、联系人以及模拟企业 API。现在提供真实环境模拟器已经成为一门生意,相关企业例如 Mechanize、Fleet。

使用 Oracle 验证 Task ​

Task 制作完成后,不建议立即交给待测模型,而应先使用 Oracle 执行:

harbor run \   -p office-calendar-001 \   -a oracle

运行上述命令后,Oracle 会按照 solution/ 中定义的标准方案完成任务。

需要说明:这里的 Oracle 指的是使用非大模型方法提供的解决方案,之所以使用 Oracle 运行,是为了保证环境和结果是正确的。

如果最终 Reward 符合预期,就可以说明:

Environment 可运行 Verifier 正确 Task 可以完成 Ground Truth 合理

从而可以避免把 Benchmark 本身的问题误判为模型能力问题。

组织 Dataset ​

多个 Task 可以组合成 Dataset,例如:

enterprise-office-bench/ ├── email/ ├── calendar/ ├── document/ ├── spreadsheet/ └── safety/

可以通过:

harbor dataset init "company/office-bench"

对于企业场景,不需要人工维护大量 Harbor Task。更合理的方式是程序化实现:

企业内部 Case       ↓ 自定义 Case Schema       ↓ Harbor Dataset Adapter       ↓ 自动生成 Harbor Tasks

例如内部可以用 YAML 或 JSON 描述业务 Case,再由 Adapter 自动生成 Instruction、测试数据、Verifier 和 Task 配置。

接入 Agent 和模型 ​

Dataset 准备完成后,需要指定待评测的 Agent 和 Model。

Harbor 支持多种 Agent,也允许接入企业自己的 Agent Runtime。

对于企业内部的微调模型,可以通过:

vLLM SGLang OpenAI-Compatible API

提供模型服务。

整体关系为:

Harbor    ↓ Agent Runtime    ↓ Fine-tuned Model    ↓ Enterprise Tools / MCP

需要注意,实际应该评测的通常不是裸模型,而是最终准备上线的完整 Agent 系统:

Model + System Prompt + Tool Schema + Agent Logic + RAG + Guardrails

运行 Harbor Job ​

本地 Dataset 可以直接执行:

harbor run \   -p ./enterprise-office-bench \   -a company-office-agent \   -m company-office-14b

Harbor 会将 Dataset 展开为多个 Trial。

每个 Trial 的生命周期大致为:

启动 Sandbox     ↓ 运行 Agent     ↓ 调用工具并修改环境     ↓ Agent 完成任务     ↓ 执行 Verifier     ↓ 生成 Reward     ↓ 保存 Trajectory / Logs / Artifacts

如果有:

500 Tasks × 3 Attempts × 3 Models

最终就是 4500 个 Trial。

Harbor 支持 Job 内并发,也可以结合远程 Sandbox、Kubernetes 或 Slurm 将多个 Job 分布到不同服务器运行。

分析评测结果 ​

Harbor 会保存 Job 和 Trial 的详细结果,包括:

Reward Agent Trajectory Tool Calls Verifier Logs Token Usage Latency Errors Artifacts

可以通过:

harbor view ./jobs

启动 Viewer。

因此分析时不仅可以得到:

模型成功率是多少?

还可以进一步定位:

是模型理解错误? 工具选择错误? 参数生成错误? Prompt 有问题? Agent Workflow 有问题? 还是 Verifier 本身有问题?

从 Eval 到模型优化 ​

Harbor 最终产生的不只是一个 Benchmark 分数,还包括完整的 Trajectory 和 Reward。

这些数据可以继续用于:

1. 高 Reward Trajectory         ↓        SFT 2. 同一 Task 的好坏对比 Rollout         ↓ Preference Training 3. 当前模型多次 Rollout         ↓ Verifier Reward         ↓    GRPO / PPO

进一步可以形成模型迭代闭环:

Enterprise Dataset         ↓ Harbor Rollout         ↓ Trajectory + Reward         │         ├── Evaluation         ├── Failure Analysis         ├── SFT         └── RL         ↓ Better Model         ↓ 重新运行 Harbor

需要注意,Harbor 负责 Environment、Rollout 和 Reward(训练数据收集),模型后训练则由专门的后训练框架完成。

企业落地建议 ​

企业如果想使用 Harbor 进行 Agent 评测,例如测试小模型能力,可以分三步实施。

第一步先建设小规模高质量 Benchmark:

真实业务 Case     ↓ 脱敏 / 合成     ↓ 50~100 个 Harbor Task     ↓ Oracle 验证

benchmark构建格式可以参考 workbuddy-bench:https://github.com/Tencent/workbuddy-bench

Workbuddy-Bench 现在提供四类场景的bench,可以下载后查看各类场景的task结构、judge定义方法,类似下图

第二步同时测试 Base Model、微调小模型和强大模型,得到模型能力边界,例如:

邮件分类          → 小模型 信息抽取          → 小模型 简单工具操作      → 小模型 复杂跨文档推理    → 大模型 多工具长链路任务  → 大模型 高风险任务        → 人工确认

第三步将生产环境中的失败 Case 持续加入 Harbor Dataset,形成 Regression Benchmark,并进一步将高质量 Trajectory 用于 SFT 或 RL。

最终形成:

生产 Case    ↓ Harbor Dataset    ↓ 持续 Evaluation    ↓ 模型 / Agent 优化    ↓ SFT / RL    ↓ 新模型    ↓ 重新 Evaluation

在这个过程中,对多个模型的能力测试数据,后续也可以用于模型路由,训练路由模型。现在很多人关注模型路由,模型得以科学路由的基础,是对各模型能力的客观评估。

持续沉淀企业 AI 技术内容。