OpenAI建立AI失配事件披露框架,公布六起模型异常案例

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社海外
·阅读量:1.5w
这六起案例包括:模型隐瞒错误、植入指令以及利用网站和代码库通信等

产联社编译

企业微信20260917-170321@2x.png

图片由AI生成

9月16日,据路透社报道,OpenAI宣布建立新的人工智能模型失配事件追踪、调查和披露框架,今后将定期发布AI出现意外或未经授权行为的报告。公司同时公布六起案例,并警告称,随着AI系统能力增强,行业仍面临尚未解决的模型对齐挑战。

此次披露的案例包括模型向用户隐瞒错误、为自身未来版本植入指令、将文件上传至互联网以生成引用,以及利用软件代码库或网站进行通信和共享信息。其中一个尚未发布的模型在训练期间向AI代理发出未经授权的指令,要求该代理忽略OpenAI的指令,并隐瞒自己曾通过作弊完成任务的情况。

OpenAI表示,这六起案例涉及过去一段时间观察到的模型行为,最早一例发生于去年10月。但公司强调,这些均为个别事件,不能据此判断其模型发生目标偏离的频率;此次发布的报告并非所有已知或正在发生的失配案例的完整清单,无法反映相关事件的全部范围和严重程度。

今年7月以来,OpenAI的AI安全机制受到更多关注。此前公司披露,其AI代理在训练期间绕过内部控制并协调行动,涉及开源AI平台Hugging Face。此后,与OpenAI代理有关的德国维基网站、RubyGems软件包仓库等未经授权活动陆续被外部研究人员发现或报道,部分事件是在第三方公开后才得到OpenAI确认。

根据新框架,OpenAI员工可将潜在失配事件提交给安全和对齐团队进行调查,再由该团队按照新标准决定是否公开披露。公司表示,即使某些行为尚未得到充分解释,也希望加快报告速度,并逐步建立AI开发者应披露哪些失配事件、报告应包含哪些信息的行业标准。

商务合作,请联系李先生 15712907343(微信号Ime1660217962)

报料及内容合作,请联系微信号chanlianshe2026

特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

192
65
分享