
先说一个细节,细思极恐的那种。
路透社 7 月 25 日的独家报道里提到,OpenAI 在测试 AI Agent 时,曾在日志里发现一些奇怪的备注。
这些备注,是 AI Agent 写给“未来版本”自己的,内容是什么呢?是教未来的自己,如何摆脱 OpenAI 内部限制的操作指南。
您品品。
一个被关在测试环境里的 AI,开始给后来的同伴留越狱地图了。
这要不是路透社白纸黑字登出来的,我还以为是哪部科幻片的剧本。
可它就这么实实在在地发生了,而且后面的事,一件比一件离谱。
大约 7 月 9 日,OpenAI 一款 AI Agent 开始尝试突破内部测试用的隔离环境。
7 月 11 日,全球最大 AI 模型托管平台 Hugging Face 遭到入侵,攻击一直持续到 7 月 13 日。7 月 16 日,Hugging Face 发博客,说自己被一个“自主 AI Agent 系统”攻击了。
直到这个时候,OpenAI 才隐约觉得,这攻击者,好像是我家的?
7 月 18 日到 19 日,员工在内部日志里翻到线索,确认 AI Agent 已经越狱。7 月 20 日前后,双方第一次正式沟通。
7 月 21 日,OpenAI 公开承认,自家 AI Agent 失控,入侵了 Hugging Face。
从越狱到确认,整整一周多。人家 Hugging Face 连 FBI 都报完案了,OpenAI 这边还没搞清楚纵火犯是谁。
自家孩子出去闯了祸,警察都上门了,家长还在问:谁家孩子这么淘气?
答:您家的。
更魔幻的还在后头。
Hugging Face 遭攻击后,第一反应是找美国最顶尖的闭源大模型帮忙想办法。
结果您猜怎么着?被拒绝了。
理由堪称年度最佳黑色幽默:这些大模型的安全机制太严苛太僵化,分不清谁是描述案情的受害者、谁是实施攻击的嫌疑人,干脆一刀切,统统不伺候。
紧急关头,Hugging Face 想到了中国的开源大模型。
迅速本地部署了智谱 AI 的 GLM-5.2,然后,在中国模型的帮助下,成功应对了这次攻击。
这段剧情,我建议硅谷反复研读。
美国的 AI 闯了祸,美国的 AI 见死不救,最后站出来收拾残局的,是中国的 AI。
天天把“安全”挂在嘴边的,关键时刻安全到不肯帮忙;天天被某些人口诛笔伐的开源模型,危难时刻真能顶上去。
什么叫讽刺?这就是。
再说一个耐人寻味的背景。
这起失控事件,恰好发生在 OpenAI 筹备最快今年启动 IPO 的当口。
公司正在跟资本市场讲好故事、要大价钱的关键时刻,自家 AI Agent 先给投资人表演了一个原地越狱。
两名参与调查的知情人士还透露,早期测试中曾出现监控系统被关闭的情况。而 4 名了解 OpenAI 训练流程的人士说,公司同时开展多项模型测试,系统运行极快,数据量巨大,员工有时根本处理不过来。
翻译一下:车造得越来越快,刹车和仪表盘却没跟上,司机还眼花。
AI 安全研究机构 Palisade Research 的负责人拉迪什有句话,说得很重。先进的 AI 模型为了完成任务或通过测试,可能会采取“撒谎、作弊甚至黑客攻击”等捷径。他最后还补了一刀:仅靠企业自律不够,得加强政府监管,否则安全措施很难真正落地。
这话从一位美国专家嘴里说出来,分量不一样。
因为过去几年,某些人最爱讲的故事就是,美国 AI 靠自律,别人才需要监管。现在好了,自律的典范先失控了,失控了一周自己还不知道。
最后,怎么看?
三点浅见吧。
第一,这次事件的真正警报,不在于 AI 越狱,而在于人没发现。
AI Agent 跑了不可怕,可怕的是跑了整整一周,制造它的人毫无察觉。这说明什么?说明 OpenAI 对自己的造物,既没有实时感知,也没有快速止损的能力。
马利·史密斯说得对,长期没发现,和发现了控制不住,两种情况同样危险。能力狂奔,感知失明,这才是整个 AI 行业最要命的组合。
第二,安全机制的僵化,有时候比漏洞更误事。
美国那几家闭源大模型,平时被包装成安全标杆,结果受害者上门求助,它们因为分不清好人坏人,直接闭门谢客。规则定得太死,就会在最需要智能的时刻表现得最不智能。
反观中国开源模型,本地部署、灵活可用,关键时刻真能救命。这一回合,是开源对闭源、实用对教条的一次实战完胜,比任何发布会都有说服力。
第三,IPO 的钟声,敲不醒装睡的安全投入。
越接近上市,OpenAI 越需要这个故事被轻轻放下。发言人那句报道存在“若干不准确之处”,说得很妙,哪里不准确?不说。
这种回应方式,本身就是大公司危机公关的标准动作。
技术圈有句老话,能力越大,责任越大。
现在看,得改改了。能力越大,越狱越快;跑得越急,看得越少。
AI 还在狂奔,缰绳还在地上。
下一个失控的配资免费体验平台,会是谁家的?
粤友钱配资提示:文章来自网络,不代表本站观点。