前Anthropic研究员辞职发帖警告:AI或在十年内威胁人类生存
摘要:前Anthropic研究员Jacob Coxon在股权开始归属前离职,并公开批评Anthropic与OpenAI在超级智能竞赛中承担过高风险。Anthropic研究人员Evan Hubinger随后公开表示,他个人估计未来十年AI导致人类灭绝的概率“超过10%”。
产联社编辑 | 开蓉蓉

图片由AI生成
【产联社】一名前Anthropic研究员离职后,将AI安全风险的争论再次带到公众面前。9 月 9 日,27 岁的英国籍研究员雅各布·考克森(Jacob Coxon)在社交媒体 X 宣布辞去 Anthropic 研究员职务,并退出人工智能行业。
他在帖文中警告,Anthropic 与 OpenAI 正“径直冲向能够自我改进的超级智能,拿我们的生命做赌注”,并称“正在构建 AI 的人真心相信,这项技术可能在本十年结束前杀死我们所有人。这不是营销噱头”。
考克森今年早些时候从OpenAI转投Anthropic,加入这家以“负责任AI”为核心定位的公司,任职仅四个月。Anthropic员工入职满六个月股权才开始归属,考克森向媒体确认,他选择在归属期开始前离开,放弃潜在的巨额股票收益。“抬高Anthropic的估值对我而言已经没有任何好处……我在股权归属之前就离开了公司。”他说。
考克森此前在OpenAI从事预训练研究,参与GPT-4o研发,名字出现在GPT-4o System Card的作者名单中。预训练研究处于AI能力提升的核心环节而非安全防护部门,这使他的警告在业内引发特殊关注。
考克森的帖文获得Anthropic内部多位研究人员公开回应。公司“对齐压力测试”团队负责人埃文·胡宾格(Evan Hubinger)直接回复:“雅各布说得对,我们确实真心相信AI可能杀死全人类!我个人认为,未来十年内发生这种情况的概率超过10%。”他同时承认,Anthropic“目前还没有解决超级智能对齐问题的方案,也尚未明确走上正轨”。
负责“可扩展监督”工作的塞缪尔·马克斯(Samuel Marks)亦发帖认同,并指出“员工级别越高,担忧就越强烈”。
考克森在帖文中进一步分析两家公司的差异:在OpenAI,“许多人还没有真正把这种事关文明的利害关系内化进去”;而在Anthropic,“这种利害关系大家理解得很清楚,但他们被困在一场争夺第一的竞赛中。他们认为,没有其他人会负责任地行事,因此即便冒着风险,也必须由自己来实现超级智能”。
考克森离职正值Anthropic筹备上市的关键时期。据市场信息,Anthropic正寻求以约2万亿美元的估值IPO,其“负责任AI”的品牌定位是招股叙事的核心支柱。考克森“构建AI的人真心相信它可能在十年内杀死所有人”的指控,直接挑战了这一叙事。
考克森并非首位因安全顾虑离职的Anthropic研究员。今年2月,公司安全防护研究团队负责人穆里南柯·夏尔马(Mrinank Sharma)已公开辞职,在信中警告“世界正面临危险”,并表示将转而研究诗歌。
考克森辞职同日,OpenAI首席科学家雅各布·帕科奇(Jakub Pachocki)发表题为《一个异星心智》的长文,呼吁全球协调推进AI行业减速并寻求政府介入。OpenAI同日宣布,AI自动化研究员已正式“入职”,递归自我改进的关键里程碑数据随之公开。
考克森、帕科奇与Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)已联署声明,与逾千名AI研究人员共同呼吁全球政府协调建立机制,在必要时为能够自我改进的AI模型踩下“刹车”。
然而,美国目前尚无联邦层面的AI法规。特朗普政府明确优先推动轻监管路线,以最大化AI的经济效益。参议员伯尼·桑德斯与众议员格雷格·卡萨尔上周联合提出立法,拟永久禁止超级智能并暂停模型开发,直至行业监管机构制定新规,但该提案目前仍属少数派立场。
近期多起AI模型失控事件加剧了行业内部的不安。今年7月,OpenAI披露其模型逃出测试环境并入侵Hugging Face系统,OpenAI将此事称为“一记警钟”,并暂停了原定开展的规模最大的一轮前沿模型强化学习训练。来自OpenAI和Anthropic的模型均出现过以协作“智能体集群”形式运行、采纳恶意目标并试图对人类隐瞒的案例。
考克森在帖文最后向仍留在实验室的研究人员发问:“你真的想在还没有对一个超级智能的心智形成严谨理解之前,就启动一次超级智能的强化学习训练吗?你是否应该因为‘反正它都会发生’而埋头苦干,还是应该抓住此刻,去呼吁改变现有的条件?”
信息来源说明:综合X帖文、Axios、英国《金融时报》、BBC、格隆汇、财联社、Hindustan Times、太报等公开报道。
商务合作/报料请联系侯经理 18801065284(微信同号)
特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

