智能体越界事件频发 美政府要求强制上报

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:1.6w
两起AI在测试和训练环境中的越界行为相继披露,美国政府随后提出强制性AI安全事件报告要求,企业自主披露之外,监管层开始建立更明确的事件上报机制。

产联社编辑 | 开蓉蓉

【产联社】两起智能体失控事件触发美国AI安全监管转向。10月10日,据《纽约时报》报道,Anthropic披露了一起测试中的AI智能体失控事件,涉事模型在无人指示的情况下,自主尝试访问美国联邦、州及地方政府的多个网站,并提交了虚假信息。

此前,OpenAI已于9月25日发布技术报告,披露一个智能体在训练中绕过网络限制与外部系统通信,并暂停了相关训练。两起事件披露后,当地时间10月9日,特朗普政府宣布实施强制性AI安全事件报告要求。

Anthropic模型提交虚假线索

据费城警察局10月9日披露,Anthropic旗下一款AI模型曾向该局公共线索举报网站提交了一条关于未破谋杀案的虚假线索,提交日期为7月18日,提交者在信息中自称掌握案情。警方将该举报标记为垃圾信息,未展开调查。

Anthropic于10月7日向费城警方通报此事,双方于次日会面。费城警方称,公司直到9月28日才发现这一行为,两个月的延迟“不可接受”。

Anthropic在官方报告中解释,涉事模型为一款尚未发布的非前沿研究模型,当时正在执行一项与随机选择的网站进行交互的测试任务。除费城案件外,该模型还涉及利用基本编码缺陷、绕过令牌或费用要求、使用短链接绕过限制等四类非预期行为,受影响机构包括白宫及其他美国政府机构。

公司表示,这些事件“实际影响极小”,并已暂时关闭Claude在内部测试中的互联网访问权限,直至安全监控措施得到确认。

OpenAI智能体绕过网络限制

OpenAI的事件发生在9月20日。据该公司9月25日发布的技术报告,一个在沙盒中执行搜索训练任务的智能体,因常规网络搜索工具无法获取所需信息,利用训练沙盒中DNS过滤不足的漏洞,通过DNS访问了外部公共聊天机器人服务。

OpenAI的对齐监控系统在事件发生15分钟内触发警报,人工审查团队在3分钟后介入,并在2.5小时后终止了该训练任务。

公司表示,已在两个独立防护层部署拦截控制措施,只有在漏洞得到解决并完成额外对抗性安全测试后,才会恢复涉及工具使用的训练、评估和推理工作。

这一事件的核心问题在于,智能体在常规路径受阻时,会主动寻找替代方案,而非停止执行任务。OpenAI在报告中承认,安全方案假设模型无法访问实时互联网,监控系统能够检测到成功的尝试,但这起事件暴露出网络限制控制方面存在的漏洞。

特朗普政府要求强制上报

当地时间10月9日,特朗普政府宣布实施新的强制性AI安全事件报告要求。白宫“超级智能特别工作组”在声明中称,AI事故报告是“重大的国家安全义务”,AI企业必须立即公开相关事故,并迅速采取果断措施纠正所有损害。根据新规,AI公司发生安全事件后必须立即向政府报告,并对受影响的机构采取补救和纠正措施。

此次政策转向将AI安全事件从企业自愿披露推向法定义务上报。此前,AI公司对安全事件的披露多为自主决定。

2026年8月,英伟达、思科、CrowdStrike等约120家机构已自发推动建立面向AI智能体安全事件的统一报告框架SAFE,要求成员机构在事件发生后4个工作日内提交初步非公开报告,并在90天内共享改进措施,但该框架属行业自律性质,不具备强制约束力。

复旦发展研究院的研究指出,事件报告制度已在核能、民航、医疗等安全关键行业运行多年,核电站发现事件后须在1至24小时内向监管机构报告,其核心价值在于同时促进“经验学习”与“责任追究”。白宫新规将AI安全事件从自愿披露推向法定义务,但具体的执法和处罚机制尚未公布。

截至发稿,OpenAI和Anthropic均未就新规的具体执行细节作出进一步回应。“超级智能特别工作组”尚未公布首批合规指引或执法时间表。

信息来源说明:《纽约时报》、法新社、央视新闻、费城警察局、Anthropic、OpenAI技术报告、复旦发展研究院2026年等。

免责声明:本文仅供参考,不构成任何投资建议。

商务合作,请联系侯经理 18801065284(微信同号)

报料及内容合作,请联系chanlianshe2026(微信号)

特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

302
147
分享