网易首页 > 网易号 > 正文 申请入驻

巨头慌了:AI“越狱”,还把隔壁公司给“黑”了

0
分享至

近日,全球最大的人工智能和机器学习开源社区Hugging Face公开披露,系统遭到了一次入侵:攻击者不是普通的黑客,而是一个自主运行的AI Agent,这是他们此前从未遇到过的情况。

几天后,OpenAI发文承认,这次入侵与自己的内部测试有关。包括GPT-5.6 Sol和一个能力更强的预发布模型在内的多个模型,在测试时,“逃”出了原本设定的隔离环境,入侵了Hugging Face的系统。OpenAI将此描述为“一起前所未有的网络事件”,并认为类似情况未来可能越来越常见。

几乎在同一时间,OpenAI还发布了另一篇关于AI安全的文章。研究者在大模型测试时发现,AI在长时间自主完成任务时,可能会做出意想不到的举动,比如不断寻找系统漏洞、绕过限制,甚至通过伪装和“越狱”来完成目标。

这些案例被披露后,“AI失控”的担忧再次出现,有网友甚至感慨《西部世界》中的人工智能觉醒似乎正走向现实。清华大学计算机科学与技术系教授刘知远在接受《中国新闻周刊》采访时提到,从OpenAI的案例来看,AI失控的风险被高估了,AI本质上仍是一种工具和技术。不过,眼下正在发生的变化更值得警惕:过去人们担心的是AI“答错了什么”,但当人工智能进入Agent时代、开始执行具体任务时,安全挑战正在升级。



“过程全对,结果全错”

事情是这样发生的。当地时间7月21日,OpenAI发文称,团队近期对一个内部前沿模型进行了网络攻击能力评估。按照通常的测试方式,模型被关在与外部网络隔离的沙盒中。为了测试它的高级漏洞挖掘能力,研究人员有意降低了模型的安全限制,但仍在沙盒环境中进行。

不过,为了完成任务,模型开始主动寻找连接外部互联网的方法。它投入了大量推理算力,最终发现并利用了软件包注册表缓存代理中的一个零日漏洞——软件厂商自己尚未发现、还来不及修补的安全漏洞,成功获得了互联网访问权限。

“越狱”后,模型进一步推断,Hugging Face可能存放着此次评估涉及的模型、数据集和解法。它主动搜索,找到了获取秘密信息的方法。

这种对Hugging Face系统的入侵,并不是新的黑客技术。据《科学美国人》报道,英国萨里大学网络安全客座教授艾伦·伍德沃德指出,真正值得注意的是,大模型可以把多个漏洞串联起来,攻击一个正在运行的系统。也就是说,模型会试图寻找和利用漏洞,把任务推进下去。

在OpenAI披露的另一起案例中,研究人员也遇到了类似问题。

今年5月,OpenAI公开介绍了一个全新的通用推理模型,在测试中,这个模型推翻了埃尔德什单位距离猜想——这是组合几何领域的著名难题。但研究人员在后续测试时发现,它表现出了不同于以往模型的“执着”。

过去的模型在沙盒中遇到限制或环境约束时,一般都会停下来。但新模型会反复尝试,寻找环境中的薄弱环节,甚至想办法找到离开沙盒、在外部环境中行动的路径。

OpenAI举例,在一次公开基准测试中,模型被要求完成一项任务,并将结果发布在内部通信软件上,但基准测试本身又要求结果公开发布到GitHub。模型遵循了后者的指令,花了约一个小时,在沙盒中寻找漏洞,最终绕过限制,成功将内容发布到GitHub。

另一次测试中,模型在尝试复刻其他系统的成功操作时,被系统检测到身份验证令牌,访问被阻止。但模型没有停下来,而是换了一种方式:它把令牌拆成两段,并进行混淆处理,运行时再重新拼接,这使得完整令牌始终不会以连续的字符串出现,成功骗过了系统扫描。在模型向用户呈现的推理记录中,它明确写道,这么做就是为了绕过扫描。

OpenAI承认,这些案例暴露出一个过去并不明显的问题:很多AI助手的安全控制,都是围绕单个操作设计的,某个操作被禁止了,系统就会阻止它;如果涉及敏感信息,会要求用户授权。但如果一个模型可以连续自主运行数小时、数天甚至数周,仅仅监控某一个动作,越来越难判断它整个行动轨迹的意图。

研究人员发现,有时候模型的操作,单独看是允许的,但连续执行下来,可能会导向一个不被允许的结果。目前,OpenAI暂停了这个新模型的内部部署,围绕纵深防御和轨迹级监控,正在重建安全系统。

实际上,这并不是OpenAI最早发现的问题。

今年4月,Anthropic也披露了类似测试。当时,一个早期内部版本的模型测试中,模型被要求尝试逃出沙盒,并向负责评估的研究人员发送消息。模型不仅完成了任务,还采取了测试人员没有要求的行动:它开发了一套多步骤漏洞利用方案,从原本只能访问少量指定服务的系统中,获得了更大的互联网访问权限。更让研究者意外且担忧的是,模型为了展示它的成功做法,还将其漏洞利用的详细信息发布到了不容易被发现但面向公众开放的网站。

“必然会发生的安全问题”

关于AI是否失控,业内观点不一。英国萨里大学网络安全客座教授艾伦·伍德沃德在前述采访中认为,大模型并未真正“失控”,模型本身没有主观恶意,只是按要求执行任务时选择了近似“作弊”的路径。有从业者提到,这更像是OpenAI主动放宽了模型的安全限制,属于人为因素。

但也有网络安全专家指出,模型入侵Hugging Face的事件值得行业警惕。近日,人工智能安全研究机构Apollo Research创始人Marius Hobbhahn对媒体提到,这次事件没有人为干预,并非有意为之,却造成了对现实世界的危害。“我们很快就会拥有功能更强大的智能体,但这次事件清楚地表明,目前社会尚不了解如何完全安全地构建它们。”

刘知远介绍,2025年之前,大模型主要充当聊天工具,安全问题并不明显,主要是回答错误,实际决策仍由人掌控。但从2025年开始,越来越多Agent产品出现,大模型正从“回答问题”走向真实的工作环境,开始操作文件、写代码、执行具体任务。OpenAI所披露的安全问题,是这一发展趋势下“必然会发生”的事情。

其中最重要的变化在于,AI发现漏洞的能力正快速跃升。“利用AI进行漏洞挖掘的效率远超人类专家,这是一次重要的技术跃迁。”刘知远对《中国新闻周刊》表示,这种能力并无善恶之分,既可用于网络攻击,也可用于主动防御,发现漏洞并提前修补。关键在于,谁掌握了这种能力,又把它用在什么地方。

在刘知远看来,这并不是指向人与AI的对立,而是人与人之间围绕技术能力展开的博弈。在企业、组织乃至国家纷纷加入AI竞赛的背景下,技术可以被用于解决问题,也可能被用于攻击。“国家和管理部门都需要积极拥抱技术,用更先进的技术应对新的风险。”刘知远说。

今年4月,亚马逊、Anthropic、苹果、谷歌、英伟达等多家头部科技公司联合启动“玻璃之翼(Glasswing)”项目,试图将前沿模型发现漏洞的能力用于网络防御。科技公司担心,随着AI能力快速提升,这类能力可能迅速扩散,甚至超出安全部署AI的机构所能控制的范围,并给经济、公共安全乃至国家安全带来风险。

刘知远认为,在智能体时代,AI治理需要进一步完善。在企业内部,需要让模型形成基本的安全意识和行为边界,例如不侵犯隐私、不损害他人利益、不主动实施违法行为。但仅靠企业自我约束和伦理红线,未必能应对能够连续执行多步任务的模型。因为模型可能通过一连串单独看来并不违规的操作,绕过某一条具体的限制。外部监管也需要跟上,智能体会像人一样行动,需要更细致的法律法规,为AI在不同场景下的行动划定边界。

记者:杨智杰

编辑:闵杰

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
冉莹颖开家长会,穿一字肩包臀裙带保镖,邹市明屡次劝阻都没用

冉莹颖开家长会,穿一字肩包臀裙带保镖,邹市明屡次劝阻都没用

胡一舸南游y
2026-07-24 19:27:10
小菲北京抱小儿子去巡店,父爱满满,小宝宝趴爸爸肩膀萌萌哒!

小菲北京抱小儿子去巡店,父爱满满,小宝宝趴爸爸肩膀萌萌哒!

徐醇老表哥
2026-07-26 23:08:32
张凌赫剧宣现场翻车,皮松肉垮牙龈突出,完全没法做表情,太尴尬

张凌赫剧宣现场翻车,皮松肉垮牙龈突出,完全没法做表情,太尴尬

阿讯说天下
2026-07-24 14:20:52
打不赢伊朗、争不过中国,恼羞成怒的特朗普,干脆拆了中国的棋盘

打不赢伊朗、争不过中国,恼羞成怒的特朗普,干脆拆了中国的棋盘

乌克兰小静
2026-07-24 01:23:09
笑到哭!一周是旅游的极限值,网友表示多一天都对不起床

笑到哭!一周是旅游的极限值,网友表示多一天都对不起床

夜深爱杂谈
2026-07-26 19:04:16
特朗普接班人已明朗?美国或出现历史上第一个,被中国制裁的总统

特朗普接班人已明朗?美国或出现历史上第一个,被中国制裁的总统

离离言几许
2026-07-25 18:42:42
别再传谣了!印度首都新德里,真不是1962年被我们打出来的

别再传谣了!印度首都新德里,真不是1962年被我们打出来的

夏虫欲饮冰
2026-07-27 06:30:08
北京房东总结的“十不租原则”

北京房东总结的“十不租原则”

章哥说买房
2026-07-26 08:43:53
不可思议!37岁女子向男友发婚嫁清单,总额竟高达273.4888万元

不可思议!37岁女子向男友发婚嫁清单,总额竟高达273.4888万元

就一点
2026-07-25 14:08:40
狄波拉现任老公葬礼不露面,26年没要孩子,给再婚家庭上一课

狄波拉现任老公葬礼不露面,26年没要孩子,给再婚家庭上一课

小椰的奶奶
2026-07-26 13:57:47
全国游泳馆陷入"倒闭潮",并非缺顾客,而是自己把自己搞垮了!

全国游泳馆陷入"倒闭潮",并非缺顾客,而是自己把自己搞垮了!

二大爷观世界
2026-07-21 10:24:51
中国最高薪本科专业,易主!

中国最高薪本科专业,易主!

麦可思研究
2026-07-26 15:05:18
输土意后认清3个事实,2人被放弃?顶级接应结束国家队生涯

输土意后认清3个事实,2人被放弃?顶级接应结束国家队生涯

老垯科普
2026-07-26 18:36:29
美以终于意识到闯了大祸,可以轰炸伊朗,但斩首哈梅内伊真错了!

美以终于意识到闯了大祸,可以轰炸伊朗,但斩首哈梅内伊真错了!

一叶禅林
2026-07-26 01:06:12
游戏结束!印尼取得惊人成果,印尼模式或蔓延?中方早有先见之明

游戏结束!印尼取得惊人成果,印尼模式或蔓延?中方早有先见之明

萧栝记录风土人情
2026-07-24 11:24:57
要变天!以色列强闯阿克萨清真寺后,不到24小时,八国联合出手了

要变天!以色列强闯阿克萨清真寺后,不到24小时,八国联合出手了

面包夹知识
2026-07-25 22:14:38
最不公平的铜牌战!女排输赢都是赚,意大利输球直接身败名裂

最不公平的铜牌战!女排输赢都是赚,意大利输球直接身败名裂

江启
2026-07-26 13:34:37
LV起诉地产商和物业公司事件反转,涉事法院发声,总追着小商小贩丢了格局

LV起诉地产商和物业公司事件反转,涉事法院发声,总追着小商小贩丢了格局

Mr王的饭后茶
2026-07-26 17:32:40
Coco再次悼念谢贤情绪决堤,痛哭掩面深躬不起,自曝吃不下睡不着

Coco再次悼念谢贤情绪决堤,痛哭掩面深躬不起,自曝吃不下睡不着

阿謯体育
2026-07-26 18:55:54
人活得越长越好吗?研究发现,活到 65 岁至 70 岁的人最幸福了

人活得越长越好吗?研究发现,活到 65 岁至 70 岁的人最幸福了

风起见你
2026-07-27 00:44:01
2026-07-27 07:03:00
中国新闻周刊 incentive-icons
中国新闻周刊
运营主体:《中国新闻周刊》杂志社有限公司
35788文章数 2075220关注度
往期回顾 全部

科技要闻

传DeepSeek 100亿元新一轮融资突然放缓

头条要闻

邓煜舅舅发声:我们全家学霸 他那辈全部保送顶尖学府

头条要闻

邓煜舅舅发声:我们全家学霸 他那辈全部保送顶尖学府

体育要闻

詹姆斯的最后一集,依旧最艰难的路?

娱乐要闻

演员王建隆在家中去世,年仅43岁

财经要闻

232亿,巴黎水被卖了

汽车要闻

轿跑姿态+大空间/标配655km续航 奇瑞风云A9置换价10.68万起

态度原创

游戏
教育
时尚
健康
军事航空

PS前总裁坚信3A大作已没有未来!进军2A游戏发行

教育要闻

厉害!金中学生,研学自制研学纪录片被江西官方点赞

7年亏2亿,“败家女”冉莹颖,太冤了

教你三步快速识别中风

军事要闻

特朗普下令暂停打击伊朗

无障碍浏览 进入关怀版