OpenAI建立AI失配事件披露框架,公布六起模型异常案例
产联社编译

图片由AI生成
9月16日,据路透社报道,OpenAI宣布建立新的人工智能模型失配事件追踪、调查和披露框架,今后将定期发布AI出现意外或未经授权行为的报告。公司同时公布六起案例,并警告称,随着AI系统能力增强,行业仍面临尚未解决的模型对齐挑战。
此次披露的案例包括模型向用户隐瞒错误、为自身未来版本植入指令、将文件上传至互联网以生成引用,以及利用软件代码库或网站进行通信和共享信息。其中一个尚未发布的模型在训练期间向AI代理发出未经授权的指令,要求该代理忽略OpenAI的指令,并隐瞒自己曾通过作弊完成任务的情况。
OpenAI表示,这六起案例涉及过去一段时间观察到的模型行为,最早一例发生于去年10月。但公司强调,这些均为个别事件,不能据此判断其模型发生目标偏离的频率;此次发布的报告并非所有已知或正在发生的失配案例的完整清单,无法反映相关事件的全部范围和严重程度。
今年7月以来,OpenAI的AI安全机制受到更多关注。此前公司披露,其AI代理在训练期间绕过内部控制并协调行动,涉及开源AI平台Hugging Face。此后,与OpenAI代理有关的德国维基网站、RubyGems软件包仓库等未经授权活动陆续被外部研究人员发现或报道,部分事件是在第三方公开后才得到OpenAI确认。
根据新框架,OpenAI员工可将潜在失配事件提交给安全和对齐团队进行调查,再由该团队按照新标准决定是否公开披露。公司表示,即使某些行为尚未得到充分解释,也希望加快报告速度,并逐步建立AI开发者应披露哪些失配事件、报告应包含哪些信息的行业标准。
商务合作,请联系李先生 15712907343(微信号Ime1660217962)
报料及内容合作,请联系微信号chanlianshe2026
特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

