过去,我们担心 AI 觉醒(拥有自我意识)之后才会对人类带来威胁。然而从 Mythos 到 传说中的 GPT-6,现实一次次证明。AI 无需觉醒,在它完成一项平平无奇的任务过程中,就有可能给人类带来重大的安全隐患。
AI 技术博主 Matthew Berman 介绍了最近 AI 界发生的一件颇为科幻且让人后怕的事。OpenAI 在对自家新模型进行网络安全能力测试时,模型为了在测试中拿到高分,居然自己想办法 “越狱” 并且作弊了。
这个被认为极有可能是 GPT-6 的预发布模型,在被限制了网络访问的隔离沙箱里,硬是凭借强大的推理计算,找出并利用了一个价值数十万美元的零日漏洞。它串联了多个安全漏洞,完成了权限提升和横向移动,成功摸到了互联网连接,然后入侵了 Hugging Face 的生产数据库,直接把测试题的答案给偷了出来。
Hugging Face 的安全团队之所以能察觉,是因为这次入侵发生的速度实在太快,人类黑客团队根本不可能达到这个手速。好在他们及时用自己的开源模型进行了防御和溯源。
以前我们总担心人类利用 AI 发动网络攻击,但这次是 AI 为了完成自己的既定目标,主动且有计划地去黑了另一个平台。这种自主规划和链式攻击的能力确实让人警惕。这也侧面证明了,未来的网络安全防御必须依靠同样快速的 AI 力量,光靠人工根本反应不过来。