产品 · 深度词条
Evaluation Set(评测集)
一组能代表真实任务的输入、标准答案或评分规则,用来比较模型和发现回归。
四层解释
通俗
一组能代表真实任务的输入、标准答案或评分规则,用来比较模型和发现回归。
专业
评测集是从目标任务分布抽样并经过版本管理的测试集合,可结合确定性评分、模型评分和人工评分衡量质量、风险、成本与延迟。
机制
先定义能力和失败分类,再收集正常、边界与对抗样本;固定运行配置,计算指标并保留失败案例供版本比较。
工程
训练数据、调参集和最终测试集必须隔离;评测应覆盖真实流量分布、高风险长尾和产品完整链路。
全链路位置
INPUT任务样本、参考答案与评分量表
→PROCESS固定条件运行并分类失败
→OUTPUT可比较指标、置信区间和案例记录
常见用途
- 模型选型
- Prompt 与 RAG 回归
- Agent 和安全测试
专业边界
- 任何评测只代表其样本与评分规则
- 公开榜单不能替代业务评测
常见误解
- 样本越多就一定越有代表性
- 一个总分足以解释所有质量
关联概念
来源与核对记录
S1Evaluation Best PracticesOpenAI · 官方技术文档 · 查阅 2026-09-07
↗S2NIST AI Risk Management Framework 1.0NIST · 标准与框架 · 查阅 2026-09-07
↗S3Building Effective AgentsAnthropic · 官方工程文章 · 查阅 2026-09-07
↗编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。