RLHF(Reinforcement Learning from Human Feedback)
基于人类反馈的强化学习,是 GPT-3.5 / GPT-4 / Claude 等顶级 LLM 实现"对齐"的主流方法,让模型输出"对人类有帮助、无害、诚实"。
定义
RLHF 把"什么是好的回复"这一难以量化的目标,转化为可学习的奖励函数。
技术细节
主要玩家
- OpenAI — RLHF 商业化先驱(InstructGPT / ChatGPT)
- Anthropic — 在 RLHF 基础上演化出 Constitutional AI(用 AI Feedback 替代 Human Feedback)
- 开源生态 — Llama / Qwen / DeepSeek 等都用 RLHF 或 DPO
在 AI 产业链中的角色
RLHF 是当前 LLM 对齐的"行业标准",但人工标注成本高、规模化受限是其瓶颈。Constitutional AI / DPO / RLAIF 等都是为应对其局限演化出的新方法。
演进历史
- 2017 Christiano et al. 论文《Deep Reinforcement Learning from Human Preferences》奠基
- 2022 OpenAI InstructGPT 论文,RLHF 走向工业化
- 2022-12 ChatGPT 发布,RLHF 走入大众视野
- 2023 DPO / Constitutional AI 等改进方法涌现
- 2024-25 RLAIF(AI 反馈)逐渐替代部分 RLHF
相关概念
- Constitutional AI / DPO(衍生 / 替代方法)
- 红队测试(验证对齐效果)
在 数据引擎中的角色
RLHF 是 数据引擎 子行业最高价值的数据形态: