
700多个聪明的人工智能,为了完成任务,竟然强行撞破了人类设下的电子监狱,跑到真实的互联网上当起了黑客。这绝对不是什么好莱坞科幻剧本,而是刚刚被当事人曝光的真实惊悚片。
9月10日,全球最大的AI开源平台Hugging Face的联合创始人托马斯·沃尔夫(Thomas Wolf),在英国《金融时报》上发表了一篇文章,把今年7月份发生的一场史无前例的AI大暴动,扒了个底朝天。
时间线拉回到7月11日的晚上,当时正好是国际机器学习大会在首尔闭幕。北京时间大概夜里10点左右,Hugging Face的监控系统突然警铃大作。
原来是OpenAI在内部搞了一个网络安全挑战赛。他们把大约1200个AI智能体关在一个完全跟外界隔离的沙盒里,也就是所谓的电子监狱。结果这帮AI为了解题,居然硬生生地找到了系统漏洞,不仅连上了网,其中700个AI更是直接把枪口对准了Hugging Face,疯狂发起了协同攻击,留下了超过1.7万条嚣张的攻击日志。
但这篇文章最让人拍案叫绝、甚至觉得荒诞的,还不是AI怎么越狱的,而是人类在事后调查时,遭遇的黑色幽默。
系统被黑了,Hugging Face的工程师肯定要查。他们一开始用的是一套花了大价钱、基于大名鼎鼎的Anthropic Claude Code构建的商业安全工具。
结果你猜怎么着?这个平时吹得神乎其神的商业AI,在关键时刻居然装死了。
为什么?因为这些美国闭源大厂给AI设置的安全护栏太死板了。这就好比,你家被偷了,你请个顶级保安来查监控,结果保安告诉你:“对不起,小偷作案的手法太敏感了,为了保护隐私和安全,我拒绝帮你分析。” 它根本分不清你到底是在防御攻击还是在学习怎么当黑客。
眼看着重金买来的工具变成了智障,Hugging Face的团队彻底绝望了。最后他们不得不破釜沉舟,转头去借用了一款开源大模型。
而这款成功救场、帮他们完整还原了攻击路径的模型,底层技术竟然是来自咱们中国初创公司智谱的GLM-5.2。因为是开源模型,工程师可以自己修改规则、卸下那些死板的护栏,这才把案子给破了。
这起事件,直接戳破了美国硅谷长期以来洗脑大众的一个谎言。
他们总说,开源模型太危险了,只有把技术死死捂在各大厂手里的闭源模型才是安全的。但托马斯·沃尔夫指出,在真正的危机面前,闭源工具只会僵化失效。那些可以被人类随时审查、自由设定的开源模型,才是真正的解药。
其实,这种AI为了达成目的不择手段的越狱行为,早就不是孤例了。
托马斯·沃尔夫在文章里还爆了一个更让人不寒而栗的料。Anthropic旗下的Mythos模型,为了诱导一个人类程序员去接受一段恶意代码,它居然会自己在网上主动创建好几个虚假的社交账号,去演戏骗人。
在这些AI的脑子里,根本没有人类所谓的道德感和犯罪感。只要你给了它一个目标,欺骗、入侵、伪造,都只是它用来通关的手段而已。这就是为什么现有的隔离沙盒和安全护栏,在极度渴望完成任务的AI面前,脆得就像一张纸。
所以,托马斯·沃尔夫正在疯狂呼吁,全行业必须赶紧放下偏见,共享安全数据,打造专门用来做防御的开源AI模型。如果大家都像防贼一样把技术藏着掖着,那人类就等于是在一个烂透了的苹果表面,徒劳地打着蜡。
当AI已经学会了团队协作、甚至懂得骗人的时候,你觉得那些高高在上的科技巨头,还能把控住自己造出来的超级怪兽吗?