训练 · 深度词条

DPO(Direct Preference Optimization,直接偏好优化)

直接用“更喜欢的回答”和“较差回答”训练模型,不必先单独训练奖励模型再跑复杂强化学习。

深度词条核对 2026-09-072 条来源

四层解释

通俗

直接用“更喜欢的回答”和“较差回答”训练模型,不必先单独训练奖励模型再跑复杂强化学习。

专业

DPO 通过对偏好概率模型的重新参数化,将带 KL 约束的偏好优化转化为策略模型上的分类式目标。

机制

训练同时比较 chosen 与 rejected 回答相对参考模型的对数概率差,使模型提高偏好答案的相对概率。

工程

DPO 简化了流程,但仍依赖偏好数据质量、参考模型、温度系数和离线评测,并非自动优于所有 RLHF 方案。

全链路位置

INPUT提示与成对偏好回答
PROCESS直接优化偏好分类目标
OUTPUT偏好分布被调整的策略模型

常见用途

  • 助手行为对齐
  • 风格偏好
  • 安全拒答边界调整

专业边界

  • 只学习数据中可观察的偏好
  • 离线目标可能与真实用户价值不一致

常见误解

  • DPO 完全不涉及 RL 思想
  • 流程简单就不需要评测

关联概念

来源与核对记录

S1
Direct Preference OptimizationRafailov et al. · 原始论文 · 查阅 2026-09-07
S2
Training Language Models to Follow Instructions with Human FeedbackOuyang et al. · 原始论文 · 查阅 2026-09-07

编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。