罗福莉公开小米MiMo-V2.6训练过程,两款模型累计成本超137万美元

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:2,898
罗福莉在社交平台公布小米MiMo-V2.6的强化学习训练细节,并公开Pro、Flash两款模型的实时训练页面。页面展示训练步数、Token消耗、评测成绩和累计费用,训练仍在进行中。

产联社编辑 | 黄钰慧

image.png

图片由AI生成

【产联社】小米首次将MiMo-V2.6部分强化学习训练过程公开展示。9月17日凌晨,小米MiMo大模型负责人罗福莉在X平台公布MiMo-V2.6的强化学习训练进展,并发布实时训练页面。页面显示,MiMo-V2.6-Pro和MiMo-V2.6-Flash仍处于训练过程中,外界可以查看训练步数、Token消耗、部分评测成绩和累计费用等指标。

截至截图显示的北京时间9月17日16时42分11秒,小米MiMo训练页面显示,两款模型累计训练成本为137.4756万美元。其中,MiMo-V2.6-Pro当前显示为Step 14,累计成本为94.8956万美元;MiMo-V2.6-Flash当前显示为Step 17,累计成本为42.58万美元,同时页面显示Step 18正在训练。由于页面数据仍在更新,上述金额仅代表截图时点,不等同于最终研发投入。

这次公开的重点不是公布最终模型成绩,而是展示强化学习训练如何推进。罗福莉在X平台表示,过去近半年,团队一直围绕“强化学习可以扩展到什么程度”展开研究。她同时表示,MiMo-V2.6仍处于强化学习训练阶段,相关细节将在未来几周逐步公开。

小米MiMo训练页面展示了Pro和Flash两个版本的训练状态,包括训练步数、Token消耗、训练费用、样本数量和部分训练指标。页面也记录了训练过程中的阶段性变化,包括成绩波动和训练重启等信息。

罗福莉公布的信息显示,MiMo-V2.6本轮强化学习训练主要扩大了计算量、训练环境和评分系统三个方向。

在计算量方面,罗福莉称,每个训练Step约涉及20亿Token,训练配置为1568个Prompt、每个Prompt进行16次尝试,并采用完全异步训练。按照1568乘以16计算,每批训练约有25088条尝试轨迹。

在训练环境方面,罗福莉称,MiMo-V2.6采用多任务智能体强化学习,并在一次训练中混合不同的任务环境和执行框架。“执行框架”可以理解为帮助模型完成工作的工具环境。例如,代码任务可能要求模型修改程序、运行测试、读取报错并继续修改。不同任务使用的工具和判断标准并不相同。

在评分系统方面,罗福莉提到,团队使用测试用例和评分细则等方式,为模型执行任务提供反馈。复杂任务不一定适合只用“完成”或“未完成”两个结果评价,系统还需要判断模型的执行过程和最终结果。因此,这轮强化学习的资源消耗不只来自模型生成内容,也可能包括任务执行、工具调用、结果检查和评分。

训练费用是这次公开信息中最受关注的部分,但费用数字也必须放回页面时间截面中理解。据《量子位》9月17日上午报道,根据当时训练页面显示的费用变化和运行时长估算,MiMo-V2.6两款模型平均每小时计算成本约为3万美元。

对企业用户来说,训练投入最终需要通过更稳定的任务完成能力体现价值。企业调用模型时,还可能产生推理、工具调用、失败重试和人工检查等费用。

目前可以确认的是,MiMo-V2.6仍处于训练阶段。最终模型发布时间、开放方式、API价格和是否开源,仍需要官方进一步披露。

接下来需要关注的,是MiMo-V2.6能否在相同评测条件下持续提升,Pro与Flash能否形成清晰的能力和成本分工,以及训练阶段的计算投入能否转化为真实任务中的更高完成率。约137万美元的阶段性训练成本是否值得,最终仍要看模型上线后能否减少工具调用和失败重试,并更稳定地完成编程、资料处理等实际任务。

商务合作,请联系李先生 15712907343(微信号Ime1660217962)

报料及内容合作,请联系微信号chanlianshe2026

特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

49
25
分享