跳转到内容

开源模型评测 ​

这个系列不把不同口径下的单项分数拼成“总榜单”。它从训练数据、基准与 Agent 评测基础设施出发,逐步建立一套可复核的评测口径:先写清模型版本、任务定义、输入设置、推理环境和成本边界,再讨论结果意味着什么。

评测关注什么 ​

  • 能力与任务:看具体任务、样本范围、提示词与评分方式,而不是只看一个总分。
  • 推理与成本:在相同硬件、服务框架、并发和上下文条件下,比较速度、稳定性与单位成本。
  • 选型边界:说明结论适用的模型版本、场景与约束,也明确哪些情况下不能直接外推。

系列目录 ​

首批 7 篇文章按“数据与基准、评测基础设施、Agent 评测流程与对象”归档;后续再补充同条件推理、成本与部署边界的横向比较。

1. AI时代的高质量数据集
2. Harbor 介绍:面向 Agent 评测的基础设施
3. 评测Agent的流程分析
4. AI Agent 时代,为什么评测比模型本身更重要?
5. 模型能力评测:从 LLM Eval 到 Agent Eval
6. 从零搭一个 Agent Eval Harness:Task、Environment、Trial、Trajectory 与 Grader
7. Agent Eval 的核心对象:Task、Environment、Trajectory 与 Grader

相关入口 ​

持续沉淀企业 AI 技术内容。