资讯
千问Qwen 3.8 Max-0902版发布:1个月时间内代码能力暴涨 超越Opus5
📌 概要
阿里发布Qwen 3.8 Max-0902,与8月版同底座(2.4万亿参数、100万上下文),重点强化Coding和Cowork后训练,编程性能一个月内成倍提升,TerminalBench 3.0从11.3升至29.0,DeepSWE、QwenSWEbench等8项任务全面上涨,号称超越Opus 5。API价格不变,输入2美元、输出6美元/百万Token,Agent与多模态仅小幅提升。
⚡ 关键要点
- ▸Qwen 3.8 Max-0902上线QwenCloud API,同底座2.4万亿参数、100万上下文,升级不加价
- ▸重点强化Coding与Cowork后训练,8项编程任务全面提升,TerminalBench 3.0从11.3涨至29.0
- ▸编程能力号称超越Opus 5,但Agent与多模态提升有限
快科技9月2日消息,这一天内又有多个大模型发布,除了Fable 5.1/Mythos 5.1之外,谷歌的Gemini 3.8 Flash也发了,阿里也发了Qwen 3.8 Max-0902,一个月时间内编程性能成倍增长。
Qwen3.8-Max-0902现已上线QwenCloud API,价格保持不变,仍为输入2美元、输出6 美元/百万Token,升级不加价好评。
Qwen 3.8 Max-0902跟8月发布的Qwen 3.8 Max是同一个底座大模型,依然是2.4万亿参数量,100万上下文,升级重点则是Coding和Cowork后训练,重点提升编程、复杂工作流和长时间Agent任务能力。
千问官方也公布了最新的性能基准,在Coding编程任务中8项任务全面提升,部分任务提升非常明显,TerminalBench 3.0从11.3涨到29.0,DeepSWE 1.1从56.6涨到69.3,QwenSWEbench V2从55.1涨到70.0。职业任务JobBench也从53.4涨到64.0。
Agent及多模态任务上的性能也有一定提升,不过跟之前的版本变化不是很大。
在Code Arena的WebDev评测中,Qwen 3.8 Max-0902以1691分的性能登顶第一,超过了Opus5等美国顶级大模型。


