训练 · 深度词条
Post-training(后训练)
在预训练之后继续教模型遵循指令、偏好、安全规则和工具格式,让它更像一个可用助手。
四层解释
通俗
在预训练之后继续教模型遵循指令、偏好、安全规则和工具格式,让它更像一个可用助手。
专业
后训练是 SFT、偏好学习、强化学习、安全训练和能力专项训练等阶段的集合,目标是改变模型行为分布。
机制
先用高质量示范建立指令行为,再利用人类或 AI 偏好比较优化输出,还可加入可验证任务和安全数据。
工程
后训练目标可能相互冲突,应分别评测帮助性、事实性、安全、拒答、工具使用和能力回归。
全链路位置
INPUT指令、示范、偏好与安全数据
→PROCESSSFT、偏好优化或强化学习
→OUTPUT更符合产品行为目标的模型
常见用途
- 助手指令遵循
- 工具调用格式
- 安全与领域适配
专业边界
- 对齐的是训练中表达的目标与偏好
- 不会补齐所有事实知识和工程控制
常见误解
- 后训练只是加一段 System Prompt
- 安全训练能替代应用权限
关联概念
来源与核对记录
S1Training Language Models to Follow Instructions with Human FeedbackOuyang et al. · 原始论文 · 查阅 2026-09-07
↗S2Direct Preference OptimizationRafailov et al. · 原始论文 · 查阅 2026-09-07
↗编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。