9月大模型图谱:头部厂商密集上新,AI开始比谁更“能干活”
产联社编辑 | 黄钰慧

图片由AI生成
【产联社】进入9月,大模型又迎来一轮密集上新。9月2日,Google发布Gemini 3.8 Flash;次日,OpenAI推出GPT-6 Astra。9月10日,DeepSeek发布V4.1-Flash。9月22日,Anthropic发布Claude Opus 5.5,同日OpenAI继续扩充GPT-6产品线,推出Sol和Luna两款模型。国内厂商中,阿里、月之暗面、阶跃星辰等也在本月更新模型或Agent产品。
密集发布背后,大模型竞争的关键词正在发生变化。参数规模、数学推理和Benchmark成绩依然重要,但越来越多厂商开始把Coding、工具调用、Computer Use、多模态和长程任务放到产品更新的核心位置。大模型还在比谁更“聪明”,但9月以来,一个更现实的问题被摆到台前——谁能把事情真正做完。
大模型开始比拼“执行力”
这一变化首先体现在头部模型的能力重点上。
9月3日发布的GPT-6 Astra,被OpenAI定位于处理高难度端到端工作。相比单纯强调问答和推理能力,OpenAI此次重点展示了Astra在Computer Use、浏览器操作、软件工程、网络安全、科学研究和专业工作等方面的能力。OpenAI公布的测试结果显示,Astra在FrontierMath Tier 4和ARC-AGI-3上分别取得98%和99.9%的成绩。不过,不同厂商的测试环境和模型配置存在差异,相关成绩并不适合直接横向排名。
Google的方向类似。9月2日发布的Gemini 3.8 Flash,官方将其定位为面向长程软件工程、自主Agent和复杂企业工作流的模型,并称其在保持上一代Flash速度和低成本定位的同时,提升了软件工程、Agent任务和复杂多步推理能力。
国内厂商也把升级重点放到了任务执行上。阿里9月2日更新Qwen3.8-Max-0902,重点提升复杂工程级Coding、长程自主开发、多工具调度和端到端任务交付,同时保留100万Token上下文窗口。DeepSeek则从模型架构入手。9月10日发布的V4.1-Flash采用新的非对称架构,总参数量5520亿,但输入和输出阶段分别仅激活80亿和160亿参数,同时加入原生视觉理解能力。DeepSeek称,新模型面向更高吞吐和更低推理成本设计。
从9月这一轮更新看,头部厂商仍在提高模型的基础智力,但能力升级越来越围绕真实任务展开。过去一个模型能否解决一道难题,往往是能力展示的重点。现在,能否读懂一个项目、调用多个工具、操作软件并持续执行,正在成为另一套衡量模型能力的坐标。
Agent上桌,从聊天框走进真实工作流
如果说模型能力升级是9月的表层变化,Agent则是贯穿这轮更新的一条共同主线。
9月10日,OpenAI推出Agents API公开测试版,将支撑Codex的执行框架开放给开发者。按照OpenAI的定义,一个能够长期工作的Agent不仅需要模型本身,还需要管理上下文、使用工具、协调子Agent,并拥有处理文件、运行代码和保存中间结果的环境。OpenAI称,其基础设施已经能够支持Agent连续运行数天。
这意味着,AI完成任务的时间尺度正在被拉长。
Coding是9月多家厂商重点布局的Agent场景之一。9月17日,月之暗面正式上线Kimi Code Desktop,将Kimi Code的Agent能力带入桌面开发环境。按照官方介绍,其目标模式可以持续推进长任务,并支持暂停、恢复和后台运行;计划模式则可以先生成方案,再由用户评审后执行。敏感操作提供不同级别的审批机制。
Anthropic 9月22日发布Claude Opus 5.5时,也将复杂工作和Coding作为重点。Anthropic披露,一名早期测试者使用该模型在不到一天内完成了68万行代码迁移;按照测试者的估计,同类工作由工程团队完成可能需要数周。
Agent的边界也已经不止于代码。Meta 9月8日推出个人AI Agent Muse,其运行在独立云端虚拟机中,可以通过浏览器处理邮件、旅行预订等任务,并保留用户授权和操作记录。
多模态能力也开始服务于这一过程。9月1日,Google为Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite上线Agentic Video Understanding,模型可以根据任务主动调用视频工具获取所需信息。Google称,相比传统视频处理方式,其Token消耗最高可减少88%。阿里本月上线的Qwen3.8-Omni-Flash Realtime则支持实时音视频交互,并加入远程MCP工具调用。
模型由此逐渐获得完成任务所需的不同组件。推理负责判断,多模态负责感知,工具和Computer Use负责操作,长上下文和记忆负责维持任务状态,Agent则把这些能力组织成一条连续工作流。
这一变化甚至开始进入行业测试标准。MLCommons 9月16日发布MLPerf Inference v6.1,首次加入Edge Agentic Inference测试,用于衡量Agent式Coding等多轮工作负载。相比一次提问、一次回答的传统推理,这类任务需要模型持续积累上下文、获取信息并反复推理。
企业从“Token价格”算到“任务价格”
模型越来越能干的同时,另一个变化也在发生,厂商仍在继续压低使用成本。
Anthropic称,Claude Opus 5.5在多数任务上达到Claude Fable 5.1水平,完成相同工作的运行成本较Opus 5降低40%。DeepSeek V4.1-Flash则把KV Cache所需的HBM和SSD空间分别压缩至上一代的四分之一和八分之一,并同步下调API价格。
OpenAI也开始用不同模型覆盖不同成本区间。9月22日推出的GPT-6 Sol和Luna中,Sol标准API输入和输出价格分别为每百万Token 2美元和10美元;更轻量的Luna分别为0.1美元和0.5美元。两款模型均支持文本和图像输入。
这轮降本的意义在Agent时代更加突出。传统聊天模型通常只需要完成一次或几轮交互,而Agent可能需要连续搜索资料、读取文件、调用工具、修改结果,甚至运行数小时或数天。调用次数和上下文不断累积后,单个Token的价格只是成本的一部分。
因此,对企业而言,更值得关注的指标正在从“每百万Token多少钱”进一步延伸到“完成一个任务多少钱”。
代码迁移、行业研究、客服处理、数据分析等任务能否以稳定成本完成,将直接影响Agent能否从演示进入规模化生产。模型厂商也开始在能力、速度和成本之间寻找新的平衡点。阶跃星辰本月公布的Step 5 Preview,就直接以智能水平与任务成本的“帕累托前沿”作为模型定位,面向软件工程、专业知识工作和金融等Agent场景。
中外厂商争夺新的产业入口
方向趋同不代表各家路径完全相同。
OpenAI正在把模型、Codex和Agents API连接起来,从底层模型向Agent运行基础设施延伸。Anthropic继续强化Claude在Coding和复杂专业工作中的能力。Google则将Gemini能力向云服务和开发工具等生态延伸。Meta的Muse则直接切入个人Agent,让AI获得独立运行环境并代替用户操作应用。
国内厂商同样在向Agent靠拢,但路径更加多样。
阿里一边升级Qwen的Coding、多工具调度和多模态能力,一边依托云服务提供模型调用。月之暗面则把Kimi Code继续向长程编程和桌面开发环境推进。DeepSeek则继续从模型架构和推理效率切入。
从模型、开发工具到Agent运行环境,头部厂商正在将竞争延伸至模型之外。对企业而言,模型本身仍是底层能力,但谁能让模型更稳定地接入工具、软件和业务流程,正在成为Agent落地过程中新的竞争点。
Agent带动新一轮基础设施需求
Agent进入更复杂的任务,也在带动相关基础设施需求增加。
首先是Agent运行所需的基础设施。一个能够持续工作的Agent,需要上下文管理、长期记忆、工具调用、MCP、多Agent调度以及稳定的运行环境。OpenAI专门推出Agents API,将上下文管理、工具调用、子Agent协调、文件处理和代码运行等能力整合进Agent执行框架,反映出模型之外的运行环境正在成为Agent落地的重要组成部分。
模型也开始参与AI基础设施本身的开发。智谱9月17日披露,在GLM-5.3-Flash的国产AI加速器集群适配过程中,由GLM-5.3驱动的Infra Agent参与了大量基础设施开发和优化工作。智谱称,该系统从初步适配到生产可用耗时不到两周,端到端吞吐较初始版本提升约3倍。相关数据来自智谱自身项目复盘。
随着任务变长,Agent的应用边界也在继续扩展。OpenAI 9月8日公布了一套针对纳维—斯托克斯千禧年大奖难题的AI生成候选解法,并公开Lean形式化验证结果。OpenAI称,核心解题工作由一款仍在训练、能力显著超过GPT-6 Astra的内部模型驱动,Agent在启动约88小时后得到结果;随后GPT-6 Astra用17小时完成Lean形式化和验证。仅纳维—斯托克斯项目就使用约1300亿输出Token。OpenAI同时表示,无意凭此结果申领奖项。
从Coding、基础设施开发到科研,这些案例意味着Agent能够参与的任务正在变得更长、更复杂,同时也对运行环境、算力和任务管理提出更高要求。
安全则是另一项随Agent能力扩展而出现的需求。聊天机器人出错,更多时候意味着“说错话”。能够操作浏览器、代码库、邮件和企业系统的Agent出错,则可能变成“做错事”。这让权限控制、沙箱、身份认证、操作审计和Agent监督成为新的基础设施需求。
Meta已经在Muse中加入独立的Sentinel Agent,所有联网操作需要经过其检查,发送邮件、购买等敏感操作还需要用户确认。OpenAI也在GPT-6 Astra发布时披露,由于其网络安全能力达到公司Preparedness Framework中的Critical级别,已加强模型隔离、全轨迹监控等防护措施。
再往上,则是具体行业和岗位。Coding已经成为9月多家厂商重点布局的Agent场景,科研、办公、数据分析、金融等复杂任务也在跟进。对于企业而言,真正值得关注的可能不再是“是否接入一个大模型”,而是哪些业务流程已经能够被拆解成Agent可理解、可执行、可检查的任务。
截至9月24日,这轮大模型密集更新尚未结束。但从已经发布的产品看,一个方向正在变得清晰,大模型没有停止比“聪明”,但竞争正在从生成一个更好的答案,延伸到完成一个更复杂的任务。
当AI能够看懂屏幕、调用工具、操作软件,并在更长时间里持续完成任务,模型能力的下一轮竞争,也将越来越多地发生在真实工作流里。
商务合作,请联系侯经理 18801065284(微信同号)
报料及内容合作,请联系chanlianshe2026(微信号)
特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

