Claude、GPT、小米MiMo密集发布新模型:性能之外,成本竞争升温

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:4,913
Anthropic、OpenAI和小米先后发布Claude Opus 5.5、GPT-6 Sol与MiMo-V2.6。三款模型分别从旗舰能力、模型分层和开放权重切入,竞争重点从单纯追求性能峰值,延伸至任务成本、训练效率与开发者生态。

产联社编辑 | 黄钰慧

image.png

图片由AI生成

【产联社】大模型厂商正在把竞争从“谁的模型更强”,推进到“谁能用更低成本完成更多任务”。9月22日前后,Anthropic发布Claude Opus 5.5,OpenAI推出GPT-6 Sol,小米发布并开放权重MiMo-V2.6系列。小米称,MiMo-V2.6-Pro在Artificial Analysis Intelligence Index中取得46分,超过Kimi K3和Qwen3.8 Max,成为该榜单当前得分最高的开源模型。MiMo-V2.6-Pro由此位居全球开源模型和国产开源模型前列。三款模型的产品形态和测试口径不同,但都把效率放到了更重要的位置。

这轮发布还出现了一个新变化。模型厂商不再只公布模型分数,也开始强调缓存价格、单任务成本、训练投入和开发者可复用资源。模型的能力、价格和开放程度,正在成为模型竞争的共同变量。

三款模型走向不同产品路线

三款模型的共同方向,是让AI从生成答案进一步走向完成复杂任务。

Anthropic称,Claude Opus 5.5是Claude 5.5系列首款模型,在多数工作上的表现达到Claude Fable 5.1水平,相比上一代Opus 5,典型任务运行成本降低约40%。Anthropic将其重点应用场景描述为高级编程、智能体和知识工作,并称模型能够处理大型代码库中的功能开发、调试、重构和代码审查。

OpenAI则将GPT-6 Sol定位为GPT-6模型家族中平衡能力和成本的模型。OpenAI开发者文档显示,GPT-6 Astra面向最复杂的推理和编码任务,GPT-6 Sol用于复杂编程和智能体工作流,GPT-6 Luna则面向成本敏感型、高频任务。

小米MiMo-V2.6包含Pro和Flash两个原生全模态模型。小米称,该系列是其探索“递归自我改进”路径的一步,主要通过扩大强化学习计算规模,让模型在复杂任务环境中持续训练,并将模型权重、技术报告和强化学习资源向社区开放。

从产品定位看,Claude Opus 5.5强调闭源旗舰模型的能力和成本优化,GPT-6 Sol强调模型能力的分层使用,MiMo-V2.6则将开放权重和强化学习训练作为差异化方向。三者测试条件和产品形态不同,不能仅凭单一榜单排出统一排名。

Claude Opus 5.5下探旗舰模型成本

Anthropic此次升级的重点,不只是提高Opus系列的模型能力,也包括降低长时间运行智能体的使用成本。

Anthropic公布的Claude Opus 5.5 API价格为每百万输入Token 4美元、每百万输出Token 20美元,缓存读取价格为每百万Token 0.20美元。与上一代Opus 5相比,输入和输出Token价格均下降约20%,缓存读取价格下降60%。Anthropic据此估算,在典型工作负载下,Opus 5.5的整体运行成本约下降40%。

对于代码代理、知识工作代理和计算机操作代理而言,任务通常需要反复读取系统提示、代码库、历史对话和工具结果。缓存读取价格下降,可能降低长上下文任务的重复输入成本,但最终账单仍取决于缓存命中率、模型输出长度以及完成任务所需的步骤数量。

Anthropic还提供Opus 5.5的Fast模式,最高可实现约2.5倍速度,但输入和输出价格分别提高至每百万Token 8美元和40美元。对于需要快速响应的业务,企业需要将速度收益与更高调用价格一并核算。

在能力方面,Anthropic称Opus 5.5重点提升了智能体编程、知识工作和计算机操作能力,并邀请外部评测人员参与发布前测试。

GPT 6 Sol通过模型分层扩大使用规模

GPT-6 Sol的重点,是把部分高端模型能力带入更高频、更大规模的工作流程。

OpenAI将GPT-6模型家族划分为Astra、Sol和Luna三个层级。Astra面向最复杂的端到端工作,Sol用于需要较强推理能力的复杂任务,Luna则用于更高频、重复性更强的工作。这样的产品分层,允许用户根据任务难度和预算选择模型。

GPT-6 Sol的标准价格为每百万输入Token 2美元、每百万输出Token 10美元,缓存输入价格为每百万Token 0.20美元。OpenAI还提供批处理、灵活处理和Fast模式等服务选项,用户可以根据任务时效性和预算进行选择。

GPT-6 Sol的应用重点包括代码开发、代码审查、调试、数据分析和多步骤智能体任务。这些任务通常需要多轮推理、工具调用和结果检查,因此模型每百万Token的价格,并不能代表一项工作最终需要支付的全部费用。

缓存机制也是OpenAI此次强调的能力。对于长期运行的智能体,如果系统指令、项目背景或代码上下文能够被重复利用,模型就不必每次重新处理完整输入。不过,实际节省程度仍取决于应用的上下文组织方式和缓存命中率。

MiMo V2.6押注大规模强化学习

MiMo-V2.6的新增看点,不只是进入Artificial Analysis开源模型榜首,还包括强化学习训练规模扩大,以及模型向3D建模、计算机操作和科研任务延伸。

小米官方披露,MiMo-V2.6-Pro在Artificial Analysis Intelligence Index中取得46分,超过Kimi K3和Qwen3.8 Max,成为该榜单当前最强的开源模型,并位居全球开源模型和国产开源模型前列。小米同时承认,MiMo-V2.6-Pro与Claude Fable 5.1、GPT-6 Astra等最强闭源模型相比仍有差距。

价格方面,MiMo-V2.6系列沿用V2.5系列API定价。小米称,在同等智能水平下,MiMo-V2.6-Pro的价格约为海外模型的二十分之一至六十分之一。

小米还公布了MiMo-V2.6的强化学习训练数据。Flash和Pro两个模型的训练历时不到6天,各完成30步,累计约75万条轨迹,训练成本分别约为85万美元和262万美元。训练任务平均通过率分别相对提升25%和12%。在样本外的DeepSWE v1.1长程软件工程评测中,Flash从48.8分提升至65.7分,Pro从58.4分提升至72.6分。

小米将这次训练概括为三个方向,即更大的Batch和更高吞吐、更多任务与复杂环境,以及更大的Grader算力。官方材料显示,单次更新使用1568个样本,支持100万上下文长度训练,单步训练Token达到35亿至37亿;训练任务覆盖代码、通用任务、视觉和网络安全等方向。

在训练稳定性方面,小米称其冻结了MoE Router,以抑制专家负载漂移,同时建立覆盖奖励设计、对抗性评测、异常检测和验证器交叉校验的Reward Hacking防线。

从跑分到真实任务

MiMo-V2.6的最新发布还增加了若干具体应用案例。

在游戏开发中,小米称MiMo-V2.6可以根据图片、视频或文字需求拆解任务,由多个智能体协作完成3D场景搭建、交互逻辑编写和视觉验证,并根据渲染结果进行修正。模型还能够根据文字或参考图片,在Blender中完成物体和场景的三维建模。

在计算机操作任务中,小米称MiMo-V2.6能够理解复杂图形界面,使用办公和生产力工具完成信息检索、编辑与数据处理,并根据视觉反馈检查结果、调整后续行动。

科研案例方面,小米称MiMo-V2.6-Pro协助研究人员设计用于吸附PFAS的金属有机框架材料,并调用开源计算工具进行模拟筛选。在数学形式化方面,模型协助研究人员在Lean 4中完成Li-Yorke定理的形式化,最终形成6000余行Lean源码,并通过Lean内核核验。

小米还称,MiMo-V2.6-Pro在Design Arena上的表现与Claude Opus 5、GPT-5.6 Sol相近。不过,Design Arena属于特定设计评测场景,不能据此推导模型在所有代码、知识工作或企业任务中都达到同等水平。

除了模型本身,小米同步开放了Pro和Flash模型权重、技术报告、超过7000个强化学习任务环境、端到端强化学习训练框架和轻量化Harness。小米还开放了MiMo-V2.6-Distill-Qwen-9B及配套研究资源,供研究者复现和验证训练方法。

三款模型的API价格可以比较,但需要统一币种、Token口径、模型版本和调用方式。不同厂商对缓存、Fast模式、批处理和区域服务的计费方式不同,单价差异不能直接等同于最终任务成本。

从目前公开信息看,Claude Opus 5.5的重点是提升闭源旗舰模型的复杂任务能力并降低典型运行成本,GPT-6 Sol试图通过模型分层扩大高强度任务的使用规模,MiMo-V2.6则以开放权重、大规模强化学习和较低价格进入开源模型竞争的前沿位置。

三款模型的后续竞争,还要看公开评测之外的实际调用量、开发者反馈和商业化表现。

商务合作,请联系侯经理 18801065284(微信同号)

报料及内容合作,请联系chanlianshe2026(微信号)

特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

46
21
分享