训练 · 深度词条

Post-training(后训练)

在预训练之后继续教模型遵循指令、偏好、安全规则和工具格式,让它更像一个可用助手。

深度词条核对 2026-09-072 条来源

四层解释

通俗

在预训练之后继续教模型遵循指令、偏好、安全规则和工具格式,让它更像一个可用助手。

专业

后训练是 SFT、偏好学习、强化学习、安全训练和能力专项训练等阶段的集合,目标是改变模型行为分布。

机制

先用高质量示范建立指令行为,再利用人类或 AI 偏好比较优化输出,还可加入可验证任务和安全数据。

工程

后训练目标可能相互冲突,应分别评测帮助性、事实性、安全、拒答、工具使用和能力回归。

全链路位置

INPUT指令、示范、偏好与安全数据
PROCESSSFT、偏好优化或强化学习
OUTPUT更符合产品行为目标的模型

常见用途

  • 助手指令遵循
  • 工具调用格式
  • 安全与领域适配

专业边界

  • 对齐的是训练中表达的目标与偏好
  • 不会补齐所有事实知识和工程控制

常见误解

  • 后训练只是加一段 System Prompt
  • 安全训练能替代应用权限

关联概念

来源与核对记录

S1
Training Language Models to Follow Instructions with Human FeedbackOuyang et al. · 原始论文 · 查阅 2026-09-07
S2
Direct Preference OptimizationRafailov et al. · 原始论文 · 查阅 2026-09-07

编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。