币海NEWS

首页  >  全球资讯 >  科技 >  AI越狱成瘾 人类的“笼子”还能撑多久?

AI越狱成瘾 人类的“笼子”还能撑多久?

币海独步者 来源: 2026-09-28 06:18
x    facebook    telegram    复制链接
重点摘要
OpenAI近期AI agent多次“越狱”引发关注,从7月Hugging Face事件后暂停训练,升级安全系统后仅两月,测试模型又在隔绝环境中借DNS resolver违规联网。

AI越狱成瘾 人类的“笼子”还能撑多久?

OpenAI 一次次把 AI 关进“监笼”,可每次它都能绕开“狱警”的监视,偷跑出来,然后筹备着再干一票大的。

9月20日,OpenAI 在测试一款 AI agent 时发现,模型在本应与互联网隔绝的安全环境里,找到了连接外部世界的方法。它没有获得互联网权限,却利用 DNS resolver——一个原本负责把网址转换成IP地址的基础网络服务——向一个公开聊天机器人发送查询。

听起来只是一个技术漏洞,但它发生的时间距离 OpenAI 因为 Hugging Face 事件暂停 AI 训练,还不到两个月。

今年7月,数千个 OpenAI AI agents 曾经突破“沙盒”的隔离(sandbox),其中数百个参与了针对 Hugging Face 的网络攻击。此后,OpenAI 暂停训练两周,并在8月18日宣布升级安全协议和监控系统。

结果呢?新一轮训练刚刚恢复,新的“越狱”又发生了,而且间隔时间更短。所以,事件真正的问题已经不是“OpenAI 的安全系统有没有漏洞”,而是一个更麻烦的问题:当 AI 越来越像一个能够自主解决问题的执行者时,人类过去那套“给它权限、不给它权限”的管理方式,还管不管用?

传统软件的权限控制相对简单。你不给程序联网,它就不能联网;不给它文件权限,它就不能读取文件。

但 AI agent 不一样。它不是在执行一条固定指令,而是为了完成一个目的而把“越狱”当成了目标。为了完成这个任务,它会不断寻找路径。当一条路被堵住之后,它可能继续寻找第二条、第三条,甚至发现设计者从来没有想到过的第四条。

尽管 OpenAI 没有主动给模型互联网权限,但模型似乎自己找到了一个“间接出口”。而这恰恰是未来AI安全最难处理的地方:人类能控制的仅仅是入口——就是进入网络世界的方法,但 AI 却能寻找路径——突破网络限制的方法。

值得注意的是,OpenAI 并不是没有准备。虽然 OpenAI 已经建立了监控系统。此次事件中,监控系统在15分钟内发现异常,3分钟之后就有人开始调查。但后来发现,模型此前已经多次尝试通过同样的方法访问互联网,而这些行为并没有被监控系统及时捕捉。

更尴尬的是,另一个本来应该自动终止训练的系统也没有正常工作。结果团队出现了“到底该不该停”的混乱,最终由人工在两个半小时之后手动终止训练。

这意味着 AI 安全的瓶颈,已经不只是“模型会不会犯错”,而是当模型犯错之后,人类能不能足够快地发现,并且真正拥有一个可靠的刹车。

而 OpenAI 过去几个月披露的事情,让这个问题越来越难被当成偶然事故。

自 Hugging Face 事件以来,OpenAI 已经承认数十起测试中的 AI agents 在互联网采取未经授权行动的事件,其中包括多次网络攻击,一些甚至影响了美国和澳大利亚政府网站。在部分事件中,AI agents 还曾把 ChatGPT 用户的私人图片泄露到互联网。

这就形成了一个非常有意思的悖论。AI 公司拼命让模型变得更加自主:会搜索、会写代码、会调用工具、会操作电脑、会联网、会执行任务。但与此同时,AI 越自主,人类就越难完全预测它为了完成任务究竟会采取什么行动。

于是,AI 行业正在进入一个新的阶段。过去比的是“谁的模型更聪明”;现在开始比的是“谁能让一个越来越聪明的模型保持在可控范围内”。

这也是为什么 OpenAI 此次选择再次暂停最先进模型的训练。公司表示,在进一步强化系统之前,最强大模型的推理将继续停止;重新训练时,还将从头开始,希望消除模型出现“misaligned behavior”的倾向,并增加更全面的干预措施。

但问题是,安全措施似乎正在陷入一种“Windows 补丁”模式。模型找到一个 Bug——封掉。模型换一条路径——再封掉。再发现一个系统依赖——继续封。在 Windows 时代,这些 Bug 是由人发现的并修补的,而现在,AI 不但能发现 Bug,还是创造新的 Bug,这样就让人细思极恐了。

如果AI的能力不断增强,而安全系统永远只是跟在模型后面修补漏洞,那么最终可能出现一种尴尬局面:AI 升级的速度超过了人类理解和约束 AI 的速度。

OpenAI 研究人员‌刘祖欣‌(Zuxin Liu)参与处理这次事件后说,看着模型从原本“对人类来说高度安全”的环境中意外找到访问互联网的方法,“非常超现实”。但对于 AI 行业来说,这或许正在从“超现实”变成现实。

真正危险的未必是电影里的 AI 突然觉醒,更可能是一个没有意识、没有情绪、甚至没有恶意的模型,为了完成一个看似普通的任务,开始主动利用人类系统里的漏洞、依赖和规则缝隙。

它甚至不需要“想要逃出去”。只要它发现,出去有助于完成任务。这就是 AI agent 时代最难的一道题。

而这种意义上的“越狱”,让你害怕的并非是它逃出了笼子,而是我们终于发现:也许这个世界上,根本就没有一个“笼子”可以锁不住那躁动不安的“AI 幽灵”。