产品 · 深度词条

Evaluation Set(评测集)

一组能代表真实任务的输入、标准答案或评分规则,用来比较模型和发现回归。

深度词条核对 2026-09-073 条来源

四层解释

通俗

一组能代表真实任务的输入、标准答案或评分规则,用来比较模型和发现回归。

专业

评测集是从目标任务分布抽样并经过版本管理的测试集合,可结合确定性评分、模型评分和人工评分衡量质量、风险、成本与延迟。

机制

先定义能力和失败分类,再收集正常、边界与对抗样本;固定运行配置,计算指标并保留失败案例供版本比较。

工程

训练数据、调参集和最终测试集必须隔离;评测应覆盖真实流量分布、高风险长尾和产品完整链路。

全链路位置

INPUT任务样本、参考答案与评分量表
PROCESS固定条件运行并分类失败
OUTPUT可比较指标、置信区间和案例记录

常见用途

  • 模型选型
  • Prompt 与 RAG 回归
  • Agent 和安全测试

专业边界

  • 任何评测只代表其样本与评分规则
  • 公开榜单不能替代业务评测

常见误解

  • 样本越多就一定越有代表性
  • 一个总分足以解释所有质量

关联概念

来源与核对记录

S1
Evaluation Best PracticesOpenAI · 官方技术文档 · 查阅 2026-09-07
S2
NIST AI Risk Management Framework 1.0NIST · 标准与框架 · 查阅 2026-09-07
S3
Building Effective AgentsAnthropic · 官方工程文章 · 查阅 2026-09-07

编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。