GPT-6 Astra发布:强化电脑操作能力,API价格贵了2.5倍

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:4,743

摘要:OpenAI发布GPT-6 Astra,重点强化计算机操作和长周期Agent能力,可以直接操作网页、CRM及专业软件,并持续完成编程、研究和办公任务。新模型API输入、输出价格均为GPT-5.6 Sol的2.5倍,同时成为OpenAI首个达到“Critical”网络安全能力阈值的模型。

产联社编辑 |  黄钰慧

image.png

图片由AI生成

【产联社】OpenAI正在让大模型从“回答问题”,操作软件并完成任务。当地时间9月3日,OpenAI发布GPT-6 Astra,并称其为目前智能水平最高、对齐表现最好的模型。Astra这次把计算机操作放到更重要的位置,可以填写网页表单、更新CRM客户记录、整理日历,也能进入专业软件完成数据分析、工程设计等任务。

GPT-6 Astra目前先向少量组织开放,未来几天将陆续面向ChatGPT Plus、Pro、Business和Enterprise用户,并通过OpenAI API和Amazon Bedrock提供。API标准价格为每百万输入Token 10美元、每百万输出Token 50美元,输入、输出价格均为GPT-5.6 Sol的2.5倍。

Astra成为OpenAI首个达到其准备框架“Critical”网络安全能力阈值的模型,更强的执行能力也带来了更高的安全要求。

从回答问题到操作电脑

Astra最明显的变化,是AI开始直接接手原本需要人在电脑上完成的操作。

按照OpenAI的介绍,Astra可以进行网络研究,并把结果整理进邮件或文档;也可以分析科学数据、生成图表、创建网站并进行前端测试,还能自主安装和测试软件,根据屏幕反馈继续排查问题。这意味着模型不再只是给出操作建议,而是开始直接进入软件环境执行任务,并根据操作结果继续推进。

这种能力已经延伸到专业软件。OpenAI展示的案例中,Astra可以使用KiCad将电子原理图进一步转化为PCB设计,也可以操作Excel、Power BI等办公工具;在3D设计场景中,模型能够先在Blender中完成房屋建模,再将模型导入Unreal Engine 5,形成可以自由探索的空间。

计算机操作的速度也有所提高。在OSWorld 2.0测试中,Astra得分72.6%,高于GPT-5.6 Sol的65.7%。OpenAI模拟实际操作延迟后,Astra平均完成一项任务约需40分钟,GPT-5.6 Sol约需75分钟,前者用时减少约47%。结合更新后的Codex运行框架,在Mind2Web测试中,Astra的任务完成速度达到当前GPT-5.6 Sol体验的1.9倍。

这意味着,大模型竞争正在从“能不能生成需要的内容”,进一步延伸到“能不能直接进入现有软件,把工作实际做完”。

从操作软件到持续完成任务

会操作电脑之外,Astra进一步强化的是把一项复杂工作持续做完。

面对信息不完整的任务,Astra可以判断缺少的信息是否真正影响最终结果。如果只是一般性细节,模型可以结合上下文继续执行;如果会改变最终结果,则向用户询问。在Codex中,模型还可以一边等待用户回复,一边继续处理不依赖这项信息的其他工作。用户中途增加要求时,Astra也会尽量保持原始目标,而不是把新指令直接当成一项全新的任务。

针对持续时间更长的编程任务,OpenAI还调整了Codex的上下文管理方式。过去任务超过上下文窗口后,模型通常需要把此前工作压缩成摘要,需求、测试结果和修改原因等细节可能随之丢失。Astra可以跨上下文窗口保存笔记,并重新搜索此前的消息和工具输出,以找回早期需求和工作记录。

这一变化也反映在软件工程测试中。在Terminal-Bench 4.0测试中,Astra得分约58%,明显高于GPT-5.6 Sol的37.3%;内部数据库迁移任务中,两者分别为63.9%和42.7%。OpenAI合作伙伴Jane Street表示,在Agent编程场景中,Astra生成的代码需要更少修改即可达到生产质量。

这类变化的意义不只是让AI“多做几步”,而是让过去需要人在不同软件和环节之间反复衔接的任务,开始可以作为一个完整目标交给模型执行。

能力更强,安全和成本门槛同步提高

Astra开始获得更多软件和系统操作能力后,企业使用模型的成本和安全门槛也随之提高。

网络安全是此次限制最严格的能力之一。OpenAI称,Astra是其首个达到“Critical”网络安全能力阈值的模型,意味着在获得适当工具和访问权限后,模型可以发现此前未知的安全漏洞,并在较少人工指导的情况下针对多个受到较好防护的系统开发攻击路径。OpenAI还披露,Astra在测试过程中发现并利用了两个此前未知的零日漏洞,目前正在向相关维护方披露。

因此,这部分能力没有完全向普通用户开放。当前版本会拒绝更高级的网络安全任务,例如生成漏洞概念验证利用代码;OpenAI则通过Daybreak逐步向经过审核的防御方开放相关能力,用于漏洞验证、恶意软件分析和检测工程等防御场景。

成本方面,GPT-6 Astra的API标准价格为每百万输入Token 10美元、输出50美元。虽然单Token价格提高,但OpenAI认为,对于越来越像Agent的模型,仅比较Token单价已经难以反映实际成本,因为一个价格更低的模型如果需要反复尝试和人工修正,最终完成一项任务的成本仍可能更高。

OpenAI给出的部分测试显示,Astra虽然单Token价格更高,但由于部分复杂任务需要的Token和尝试次数更少,实际任务成本可能下降。

随着AI开始直接操作电脑并进入企业工作流,企业需要衡量的,不只是模型能力和Token价格,还包括任务准确率、执行时间、人工介入次数,以及模型能够访问哪些数据和获得哪些操作权限。

商务合作/报料请联系侯经理 18801065284(微信同号)

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

59
24
分享
上一篇 下一篇