训练 · 深度词条
RLHF(基于人类反馈的强化学习)
让人比较模型回答,再把这些偏好变成奖励信号,引导模型更常生成被偏好的结果。
四层解释
通俗
让人比较模型回答,再把这些偏好变成奖励信号,引导模型更常生成被偏好的结果。
专业
典型 RLHF 先训练奖励模型拟合人类偏好,再用强化学习优化策略,同时约束它不要过度偏离原模型。
机制
收集同一提示下的回答排序,训练 Reward Model;策略模型通过 PPO 等算法最大化奖励,并用 KL 惩罚控制漂移。
工程
标注者构成、偏好指南、奖励投机和任务覆盖会直接改变模型行为,需要独立评测少数群体与边界场景。
全链路位置
INPUT提示、候选回答与人类偏好
→PROCESS奖励建模和策略优化
→OUTPUT更符合所收集偏好的模型
常见用途
- 帮助性和风格对齐
- 安全行为调节
- 复杂任务表现优化
专业边界
- 人类反馈不代表全社会价值
- 奖励模型可能被策略钻空子
常见误解
- RLHF 让模型获得真正价值观
- 所有后训练都属于 RLHF
关联概念
来源与核对记录
S1Training Language Models to Follow Instructions with Human FeedbackOuyang et al. · 原始论文 · 查阅 2026-09-07
↗S2Direct Preference OptimizationRafailov et al. · 原始论文 · 查阅 2026-09-07
↗编辑核对:2026-09-07。本状态表示内容与来源已登记,不代表经过外部专家审稿。