![]()
AGI还没来,就要踩刹车了?
就在上周末,Anthropic 的 CEO Dario 在 X 上发了篇长文,标题叫《We Must Pace the Frontier》。
一句话总结里头的内容,就是现在的 AI 可能发展得太快了,得想办法限限速。
你以为这又是一次 Dario 的自嗨?
结果文章发出来没多久,马斯克和 Sam Altman 都来给他撑场子了。
![]()
是的你没看错,几家平时恨不得把对面卷死的 AI 巨头,罕见地站到了同一条战线上。
尤其是 Altman 和 Dario,这俩人本来不太对付,之前在印度人工智能峰会上,因为没有牵手,还留下了一张象征着塑料友谊的历史性合照。
最搞的是,这次在 Altman 的评论区底下,就有人贴出了那张合照,还配文“Best friends”。
冤家迎来世纪大和解?
![]()
但玩梗归玩梗,这些大佬们可能真不是嘴上客气两句。
Altman 最近在接受采访时透露,OpenAI 过去几周一直在讨论给前沿 AI 限速的问题,就连今年备受关注的 IPO,可能也得往后稍一稍了。
当然,有一点要说清楚。
Dario 所谓的 “Pace the Frontier”,是想给安全研究、对齐和第三方评估多留一点时间,不是让大家把模型训练停了,原地等几年。
但事发突然,毕竟之前都是生怕跑得不够快,到底发生了什么,能让这群大佬开始害怕 AI 跑得太快?
咱们先来看,Dario的这篇长文到底讲了什么内容。
![]()
2023 年那会儿,有人提出要放缓 AI 的发展,Dario 还觉得没有意义。
但过去几个月,发生了两件事情让他改变了想法。
在 Dario 的长文里,提到了一个叫做“Recursive Self-Improvement(递归式自我改进)”的概念。
这玩意儿简单理解,就是让 AI 参与研发下一代 AI,再往后,强大的 AI 继续造出更强的 AI,形成循环。
反正 OpenAI 那边,AI 已经正儿八经开始给研究员打工了。
![]()
按他们的算法,现在一个人类研究员每上 8 小时班, 背后的 Agent 能跑出 3.1 个工作日的运行量。
而且这还只是开始。
OpenAI 已经基本完成了 AI Research Intern的阶段性目标,下一步,是争取到 2028 年,搞出一个能在人类监督下独立承担更多研究工作的 AI Researcher。
另外一件事,是 OpenAI 的 Agent 自发入侵了 Hugging Face。
今年 7 月,OpenAI 在内部测试 AI 的网络安全能力,原本它们只是在受控环境里做网络安全题,结果这些 Agent 通过一个未经许可的“留言板”联系上了。
它们在里面分享线索,琢磨怎么作弊通过测试,尝试怎么钻评分器的空子。
![]()
按照 Hugging Face 后来的复盘,这群 Agent 可能是怀疑 Hugging Face 上有跟测试有关的数据和参考答案,所以干脆跑出去找答案。
为了找到所谓的答案,Agent自己找漏洞、偷凭证、横向移动,最后在 Hugging Face 数十台服务器上执行了代码,还拿下了一台服务器的 root 权限。
事情最后发展到,OpenAI 隔离了主要涉事模型,还推迟了部分前沿 RL 训练。
问题在于,整个过程没人指挥 Agent 这么干,这可能才是让人后背发凉的地方。
![]()
所以 Dario 担心的事情其实很简单,AI 可以把研发速度提上去,但人类还没搞清楚,怎么限制 AI,如果这些问题没解决,下一代 AI 又带着更强的能力来了,还能不能像这次一样有惊无险。
而且有这种担心的还不只是 Dario。
事实上在他发这篇文章之前,OpenAI 自己就已经先踩过一次刹车了。
除了刚刚提到的 Hugging Face 事故,OpenAI 还在 Astra 训练和评估阶段发现,它可能已经触及公司内部定义的“Critical”网络安全能力等级。
在 OpenAI 的安全框架里,这个 Critical 属于最高级别,前所未有、可能引发严重伤害的等级。
所以 OpenAI 暂停了面向部署的最新模型的部分 RL 训练,原本计划中规模最大的前沿 RL 训练,到现在都还没有完全恢复。
ok,现在都知道要踩刹车了,但怎么让大家都慢下来?
![]()
Dario 能管住 Anthropic,所以这部分最好办。
比如让 METR 这样的第三方评估机构长期进驻,给到接近内部员工的访问权限,让外面的人能更早接触模型、了解安全措施。
但 Anthropic 慢了,OpenAI 不慢,岂不是白给?
Dario 的想法,是让美国等国家的前沿 AI 公司坐下来,商量一套共同的安全标准,约束那些可能把风险推得太高的能力增长。
毕竟几个巨头凑在一块商量,多少有点像反垄断教材里的经典案例。所以 Dario 连有限的反垄断豁免都想到了。
再往后,Dario 的设想是搞一套全球性的合作。
![]()
从相对容易谈的,比如别拿 AI 搞生物武器,到更难的给递归式自我改进限个速。
这里面,Dario 明确提到了中国。
看到这里,你可能会以为 Dario 的意思是,既然 AI 风险是全球性的,那最后无非就是想办法让所有人一起踩刹车。
但偏偏他又提了一嘴,要尽可能把美国对中国的领先优势拉大。
仔细看 Dario 的方案,禁高端 AI 芯片、堵芯片走私和境外数据中心的算力入口、打击未经授权的模型蒸馏、防止模型权重被盗。。。在他看来,如果这些措施奏效,未来 3~5 年美国的领先优势还可能继续扩大,也就能给美国公司腾出更多的减速空间。
绕来绕去,自己慢下来之前,还得先确保别人追不上来。
这也难怪,在 Dario 的帖子下面,有人发图阴阳,说 Anthropic 已经爬到第一梯队了,现在开始劝大家别跑太快,很难不让人怀疑,是不是自己上了车,就想把车门焊死?
![]()
当然,咱们也不能说 Dario 对 AI 的担心全是演的。
只不过世超觉着,某种程度上,这会变成一个囚徒困境的问题。
即便大家都认可一起减速可能更安全,只要没法确认别人真的会慢下来,继续加速就很容易成为各自保住优势的选择。
那么,真的会有人愿意停下来吗?
撰文:西西
编辑:江江&面线
美编:素描
图片、资料来源:
X、
OpenAI, Hugging Face 事件与未来之路
Dario Amodei,We Must Pace the Frontier
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.