阶跃发布Step 5 Preview,单任务成本约为Claude Opus 5的八分之一
产联社编辑 | 黄钰慧

图片由AI生成
【产联社】大模型的旗舰竞争,正在从单纯追求更高的模型能力,转向兼顾能力、成本和实际任务执行效率。9月20日,阶跃星辰发布新一代旗舰基座模型Step 5 Preview,重点面向AI编程、软件工程、专业知识工作和金融等场景,覆盖需要长上下文、多轮工具调用和持续执行的Agent任务。模型即日起全量开放,阶跃计划于10月15日释放模型权重。
Step 5 Preview采用稀疏MoE架构,总参数量600B,每次运行激活27B参数,支持100万Token上下文窗口,并原生支持文本和视觉输入。这种设计让模型拥有较大的总参数规模,同时每次推理只调用其中一部分参数。100万Token上下文则使其能够在一次任务中处理更长的代码、文档和对话记录。
第三方模型评测机构Artificial Analysis最新页面显示,Step 5 Preview在其Intelligence Index中获得44分,每百万Token输入和输出价格分别为1美元和2.7美元,完成该指数单项任务的加权平均成本约0.71美元。阶跃据此称,Step 5 Preview在计划开放权重的模型中位居全球前三。
跻身开源前三,旗舰模型开始兼顾成本
相比单纯提高模型规模,Step 5 Preview此次更强调模型能力和调用成本之间的平衡。
Artificial Analysis的Intelligence Index综合考察推理、知识、数学和编程等能力。目前Step 5 Preview综合得分为44分。价格方面,该模型每百万Token输入价格为1美元、输出价格为2.7美元;Artificial Analysis统计的同类比较组输入、输出价格中位数分别约为1.88美元和10美元。
阶跃将这种能力与成本之间的平衡称为推动模型的“帕累托前沿”。所谓帕累托前沿,简单来说,就是当能力、效率和成本相互制约时寻找更优组合,而不是只追求某一个指标最高。阶跃称,Step 5 Preview的设计目标正是在保持较强模型能力的同时,降低实际任务的使用成本。
这一点在Agent场景中尤其重要。相比一次问答,编程、资料研究和办公类Agent往往需要反复读取上下文、调用工具并持续执行任务,模型调用次数也随之增加。因此,当模型从聊天工具进入实际工作流后,完成一项任务所需要的总体成本,比单次API调用价格更具有参考意义。阶跃也将“长上下文、多轮工具调用和持续执行”列为Step 5 Preview重点覆盖的工作场景。
按照阶跃公布的数据,Step 5 Preview单任务成本约为Claude Opus 5的八分之一。Artificial Analysis的独立评测则显示,Step 5 Preview完成其Intelligence Index单项任务的加权平均成本约为0.71美元。
不过,该模型在评测中累计生成约1.6亿个输出Token,高于同类比较组约9200万个Token的中位数。Artificial Analysis因此评价其价格具有竞争力,但输出相对冗长。
Agent开始接手长周期任务
除了跑分和成本,Step 5 Preview此次重点展示了模型连续数小时执行任务,并根据中间结果调整下一步操作的能力。
阶跃称,Step 5 Preview面向需要长上下文、多轮工具调用和持续执行的真实工作场景。与一次生成答案不同,这类任务要求模型持续追踪此前的执行结果,利用外部反馈判断下一步操作,并在出现问题后继续修改方案。
在阶跃公布的一项开发测试中,Step 5 Preview根据自然语言需求,自主阅读ESP32设备及相关API开发文档,将一块ESP32-S3开发板改造成支持蓝牙按键和语音输入的键盘。过程中,模型不仅编写代码,还访问COM串口、调用摄像头、获取设备截图、模拟鼠标操作,并根据真实设备返回的状态和报错持续修改和调试代码,连续执行超过3小时。
阶跃还让Step 5 Preview连续执行更长时间的优化任务。在一项由阶跃设计的GPU Kernel实验中,模型获得24小时任务时间,在一张英伟达H100 GPU上持续修改程序、运行内核并测量吞吐量。阶跃公布的结果显示,约22小时后,Step 5 Preview在该实验中的峰值性能达到508 TFLOPS,Claude Opus 5在同一实验中的结果为493 TFLOPS。上述结果来自阶跃自行开展的测试。
除了编程,阶跃还将金融作为验证复杂知识工作的场景。公司围绕企业研究建立了信息检索、企业估值和深度研究三项内部评测,同时引入外部基准FrontierFinance。后者包含220道专家设计的问题和11543项评估标准,覆盖六类投资应用场景。阶跃称,Step 5 Preview在相关测试中展现了信息检索、企业估值和金融研究等能力。
从这些案例来看,阶跃此次展示Step 5 Preview的重点,已经不只是模型能否生成一个答案,而是能否在更长的任务链中持续读取信息、调用工具并根据反馈推进任务。这也是其将Step 5 Preview定位为面向真实世界Agent任务旗舰模型的重要背景。
模型迭代进一步转向Agent
成立三年多来,阶跃星辰已经从语言模型逐步扩展至多模态、推理、语音和Agent模型,Step 5 Preview是其最新的旗舰基座模型。
阶跃星辰成立于2023年4月,由前微软全球副总裁姜大昕创立。2024年3月,公司首次集中对外发布Step系列通用大模型,包括Step-1千亿参数语言模型、Step-1V千亿参数多模态模型和Step-2万亿参数MoE语言模型预览版。其中,Step-2是当时国内大模型创业公司首次发布的万亿参数模型。
到2026年2月,阶跃发布开源模型Step 3.5 Flash,模型采用稀疏MoE架构,总参数196B、每Token激活11B参数,并支持256K上下文。与此前强调通用能力不同,Step 3.5 Flash已经明确针对推理、编程和Agent任务进行优化。阶跃公布的测试结果显示,该模型在SWE-bench Verified和Terminal-Bench 2.0上的成绩分别为74.4%和51.0%。
此后推出的Step 3.7 Flash进一步强化Agent能力。阶跃将其定位为“面向生产级Agent的高效率Flash模型”,支持UI、图表、文档和图片理解,并针对API、浏览器、终端、Office工具及外部系统的长程多轮调用进行优化。从Step 3.5 Flash、Step 3.7 Flash再到Step 5 Preview,长任务执行和工具调用已经成为阶跃近几代语言模型持续强化的方向。
与此同时,阶跃也在扩展语音等多模态能力。最新的StepAudio 3 Realtime是一款端到端全双工实时语音对话模型,支持在对话中使用工具。阶跃公布的技术报告显示,该模型在Artificial Analysis Full-Duplex Bench上取得98.9%的成绩。
阶跃继续押注“AI+终端”
在训练更强模型之外,手机和汽车已经成为阶跃将模型能力投入真实场景的重要入口。
阶跃近两年持续推动模型进入消费电子和汽车终端。据《每日经济新闻》今年5月报道,阶跃Step系列多模态模型已与OPPO、荣耀、吉利等厂商合作,手机预装机量突破4200万台,覆盖国内约60%的头部手机品牌,日均服务近2000万人次。阶跃董事长印奇当时表示,公司早期聚焦通用对话模型能力,目前则依托代码等具体应用场景优化模型,后续智能体能力也需要通过终端应用场景进一步打磨。
汽车是另一项落地场景。今年3月,吉利宣布与千里科技、阶跃星辰联合打造“超级Eva+G-ASD 4.0”。其中,超级Eva是三方共同研发、基于大模型底座的整车级智能体,并与智能座舱、智能辅助驾驶、底盘和动力等系统结合;吉利同时宣布极氪8X将率先搭载该系统。
这些终端场景也对模型效率提出了更直接的要求。手机和汽车中的Agent不仅需要理解用户指令,还可能需要处理视觉、语音和应用界面,并连续调用工具完成任务。阶跃在Step 3.7 Flash中已经将UI、文档、图片理解以及API、浏览器、终端和Office工具调用列为重点能力。此次Step 5 Preview则进一步将100万Token上下文、多模态输入和长周期任务执行结合到旗舰模型中。
目前,Step 5 Preview已开放API使用,阶跃计划于10月15日释放模型权重。待权重正式释放后,该模型才完成从API开放到开放权重的完整转换,其在Artificial Analysis上的状态标注也有望同步更新。
商务合作,请联系侯经理 18801065284(微信同号)
报料及内容合作,请联系chanlianshe2026(微信号)
特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

