训练 · 深度词条
DPO(Direct Preference Optimization,直接偏好优化)
直接用“更喜欢的回答”和“较差回答”训练模型,不必先单独训练奖励模型再跑复杂强化学习。
四层解释
通俗
直接用“更喜欢的回答”和“较差回答”训练模型,不必先单独训练奖励模型再跑复杂强化学习。
专业
DPO 通过对偏好概率模型的重新参数化,将带 KL 约束的偏好优化转化为策略模型上的分类式目标。
机制
训练同时比较 chosen 与 rejected 回答相对参考模型的对数概率差,使模型提高偏好答案的相对概率。
工程
DPO 简化了流程,但仍依赖偏好数据质量、参考模型、温度系数和离线评测,并非自动优于所有 RLHF 方案。
全链路位置
INPUT提示与成对偏好回答
→PROCESS直接优化偏好分类目标
→OUTPUT偏好分布被调整的策略模型
常见用途
- 助手行为对齐
- 风格偏好
- 安全拒答边界调整
专业边界
- 只学习数据中可观察的偏好
- 离线目标可能与真实用户价值不一致
常见误解
- DPO 完全不涉及 RL 思想
- 流程简单就不需要评测
关联概念
来源与核对记录
S1Direct Preference OptimizationRafailov et al. · 原始论文 · 查阅 2026-09-07
↗S2Training Language Models to Follow Instructions with Human FeedbackOuyang et al. · 原始论文 · 查阅 2026-09-07
↗编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。