阿里Qwen3.8-Max再升级,前端编程登顶CodeArena

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:2,341

摘要:阿里升级旗舰模型Qwen3.8-Max至0902版本,重点强化编程和专业办公能力。新版在CodeArena前端编程榜得分提升22分至1691分,升至榜首。目前,新模型已上线千问AI平台提供API,并接入千问办公、Qoder和千问App。

产联社编辑 | 黄钰慧

image.png

【产联社】阿里再次升级旗舰模型Qwen3.8-Max。9月2日,阿里千问宣布Qwen3.8-Max升级至0902版本。距离上一版本发布约一个月,此次更新主要围绕编程和专业办公继续进行后训练,进一步强化模型处理企业复杂任务、科研和长周期任务的能力。

最直观的变化来自编程。在第三方模型评测平台Arena的CodeArena WebDev榜单中,Qwen3.8-Max-0902得分较上一版本提高22分至1691分,目前位列第一。与此同时,新版已经上线千问AI平台提供API,并同步接入千问办公、Qoder和千问App。

这次升级延续了Qwen3.8-Max发布之初的方向。一个月前首发时,阿里已经将编程、真实办公和长周期任务作为Qwen3.8-Max重点强化的场景,此次0902版本进一步针对编程和专业办公进行后训练。

编程能力继续强化长程任务

此次后训练首先重点强化了编程能力。

截至9月2日,Arena的CodeArena WebDev榜单已经累计超过63万次投票,参与排名的模型超过120个。该榜单主要评估模型完成前端Web开发任务的表现,其中不仅包括代码生成,也覆盖需要多步推理和工具调用的Agent编程流程。目前Qwen3.8-Max-0902以1691分位列第一,Claude Opus 5 Max和Kimi K3 Max分别为1688分和1674分。

图 1 Arena CodeArena实时榜单

这次的新版本提高了22分。至少从这一榜单来看,围绕编程进行的专项后训练已经带来较为明显的成绩提升,Qwen3.8-Max-0902也进入当前CodeArena前端编程榜的第一梯队。不过,这一结果需要放在具体评测范围内理解。CodeArena聚焦前端Web开发,并不能代表模型在所有编程任务上的整体能力。截至9月2日,Qwen3.8-Max-0902在榜单中的成绩仍被标记为“Preliminary”,获得约1400次投票,后续分数和排名仍可能随着投票增加发生变化。

更值得注意的是,阿里对新版编程能力的定位已经不止于生成代码。千问AI平台介绍,Qwen3.8-Max-0902的编码能力进一步提升,可以处理更复杂的工程级项目和长程自主开发,同时增强了多工具调度和端到端交付能力。

通俗地说,模型参与编程正在从帮助开发者完成一段代码,进一步走向接手更完整的软件开发任务。在这类任务中,模型需要理解需求、持续处理代码和项目上下文,并借助工具完成执行和验证,而不是完成一次代码生成后就结束。Qoder目前也已将长时间、多步骤任务的自主执行作为Agent编程的重要使用方式。这一方向在Qwen3.8-Max首发时已经出现。阿里此前披露,在内部测试中,Qwen3.8-Max曾连续约16天自主执行一个真实软件工程项目,从零搭建一个能够持续迭代的Agent框架。过程中,模型结合用户反馈、社区实践和测试数据,持续进行代码生成、测试、预览和日志分析,最终形成开源项目“oh-my-cli”。因此,0902版本继续强化工程级项目和长程自主开发,可以看作Qwen3.8-Max此前路线的延续。相比完成局部代码任务,阿里正在进一步强化模型持续处理复杂软件工程任务的能力。

从Coding走向专业办公

编程之外,专业办公是此次后训练的另一项重点。

阿里此次明确表示,Qwen3.8-Max-0902进一步围绕Coding和Cowork进行了后训练。相比编程能力能够通过CodeArena得到较为直观的体现,Cowork更多指向模型参与现实工作,并通过工具调用和连续执行完成更复杂的任务。

这与Qwen3.8-Max此前强化复杂任务处理的方向相接。8月初首发时,阿里将其定位为当时千问规模最大、能力最强的旗舰模型。Qwen3.8-Max采用稀疏混合专家架构,总参数达到2.4万亿,每次推理激活约950亿参数,并支持最高100万Token上下文。

100万Token上下文意味着模型能够在一次任务中容纳更多信息。目前千问AI平台给出的Qwen3.8-Max-0902上下文长度为1M Token,其中最大输入约991K Token,最大输出达到131K Token。

但对于企业真实工作而言,能够处理更多资料只是基础。此次0902版本进一步强化协作Agent、多工具调度和端到端交付,同时提升图表推理、文档解析和多模态感知能力。模型也可以通过函数调用与外部工具和系统连接。

这些能力让模型能够参与更完整的办公任务。面对一组文档或数据,用户需要的可能不只是回答一个问题,还包括读取资料、解析文档、处理信息并输出结果。相比单次问答,多个环节能否顺畅衔接,也成为模型进入专业工作场景的重要能力。

因此,此次同时强化Coding和Cowork,实际上把Qwen3.8-Max的两条应用方向进一步拉到了一起。一边是软件开发中的长程自主执行,另一边则是办公场景中的多工具协作和端到端任务交付,两者都指向让模型承担比单次问答更完整的工作。

性能之外,调用成本也成考量

当模型开始承担更复杂的任务,成本的重要性也随之提高。

相比普通问答,Agent往往需要处理更长的上下文,并进行多轮模型和工具调用。任务持续时间越长,模型调用量通常也会随之增加,因此价格会直接影响企业将Agent用于高频任务的成本。

截至9月2日,Arena榜单显示,Qwen3.8-Max-0902的输入和输出价格分别为每百万Token 2美元和6美元,Claude Opus 5 Max分别为5美元和25美元,Kimi K3 Max分别为3美元和15美元。阿里千问此次援引CodeArena的综合价格口径称,Qwen3.8-Max-0902约为每百万Token 5美元,而当前性能排名第二和第三模型的同口径价格分别约为20美元和12美元。

这一数字是CodeArena用于横向比较模型性能与价格的综合口径,并不是企业调用Qwen3.8-Max时实际支付的固定价格。具体到千问AI平台,Qwen3.8-Max-0902目前输入价格为每百万Token 12元,输出价格为36元,缓存命中的输入价格为1.5元。

新版同时支持上下文缓存、批量任务、函数调用和联网搜索等功能。其中,上下文缓存可以缓存长上下文请求中的公共前缀,减少重复计算并降低成本,批量任务则通过异步批量处理请求降低调用成本。

这也让企业衡量模型的维度变得更多。当AI进入研发和办公流程,除了模型本身的效果,完成一项任务需要调用多少次、消耗多少Token以及最终需要多少成本,也会影响企业能否把Agent用于更高频的业务场景。

新版快速接入阿里产品

能力升级之后,阿里也在同步把Qwen3.8-Max-0902推向实际产品。

目前,新版已经上线千问AI平台并开放API,同时接入千问办公、Qoder和千问App。企业和开发者可以通过API调用新模型,阿里旗下的办公、编程和面向个人用户的产品也已同步接入新版。

几个产品对应的场景有所不同。千问AI平台提供模型API和开发者服务,Qoder定位为智能体编程平台,千问办公则是一站式AI生产力平台。此次重点强化的编程和专业办公能力,由此可以直接进入阿里已有的开发和办公产品。

从8月初首次发布,到一个月后再次进行专项后训练,Qwen3.8-Max的迭代方向逐渐清晰。首发版本已经重点强化自主编程、办公和长周期任务,0902版本则继续围绕Coding和Cowork进行优化,并把新版迅速接入API和现有产品。

对于企业用户而言,模型能否处理更完整的任务、以什么成本运行,以及能否快速进入已有开发和办公工具,正在成为观察旗舰大模型实际落地能力的几个重要维度。

商务合作/报料请联系侯经理 18801065284(微信同号)

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

8
2
分享
上一篇 下一篇