关于九游体育-企业动态-详情

突发,Dario提全球AI限速三步计划,奥特曼马斯克第一时间支持

2026-09-14

13日,Anthropic的CEO Dario Amodei发布了一篇罕见长文,题为《我们必须控制前沿AI的发展节奏》。文章中,他直接针对前沿模型的研发速度提出核心观点:最顶尖的AI确实需要主动减速。

Dario在文中亲口承认,“递归自我改进(RSI)已经在全行业出现”。更令人担忧的是,他预测未来6到12个月内,AI Agent集群可能会接管整个互联网。面对这种风险,他提出了一套具体的“三步刹车法”:

第一步,开门迎客:引入独立第三方常驻公司,赋予它们与内部核心风控同等级的深度访问权限。第二步,行业划线:联合全美前沿AI巨头,共同设定能力红线并建立强制安全检查站。第三步,全球落地:将这套框架推向国际,以彻底锁住不可控风险的蔓延。

话音刚落,奥特曼迅速跟进,表示“Dario是对的,OpenAI也会引入这样的评估机制”。另一边,马斯克也几乎秒回,公开支持Dario。三位巨头瞬间达成共识,场面确实罕见。

达里奥的“三步计划”,为全球AI减速

这次,Dario没有只喊一句“AI该减速”。他真正想做的是将这套“减速机制”逐级推进,顺序明确:先让AI公司自身变得可验证,再让整个行业一起踩刹车,最后才谈全球协调。

第一步,先从Anthropic自己动刀。 像METR这样的独立第三方,不应再等到事故发生后临时进公司调查,而应长期驻场。提供工位、内部电脑和接近风险团队的权限,持续监控模型训练过程、安全承诺落实、训练流程隐患以及是否瞒报。查出问题后必须公开,公司可删除涉及法律、客户隐私和核心商业机密的部分,但不能因报告难看而压下结论。

第二步:不能只让一家踩刹车。 真正难的是这里。如果Anthropic减速,而OpenAI、谷歌、xAI继续狂奔,先踩刹车的一方可能吃亏。因此,Dario建议将规则推广到整个美国前沿AI行业。几家前沿公司共同制定安全红线,设立能力检查点。模型每跨过一个危险门槛,必须先提供对应安全证据才能继续推进。例如,若模型已能突破多数隔离环境,公司需证明它不会轻易逃出沙箱、擅自接管机器或利用此能力发动攻击。证明不了,就暂缓推进。Dario甚至提到,可讨论限制训练算力、训练方式及公司内部用AI研发AI的速度,即直接为RSI加一道限速器。但仅靠私下握手不够,他更希望美国政府出手,将规则覆盖所有前沿AI公司。

第三步:把刹车踩到全球。 再往上是最难的一层。Dario将全球协调分为四级。第一层相对现实:先禁止生物武器等明显危险用途。第二层:前沿模型发布前,统一进行网络攻击、生物安全等高风险测试。第三层才真正触及核心:能否为RSI(AI研发AI的速度)设定全球上限?Dario判断此事“刚好处在可能做到的边缘”。至于第四层——全球前沿AI公司大幅减速甚至阶段性暂停训练——他本人未抱太大希望,短期内几乎不现实。卡住这一切的仍是验证问题:一家公司说停了,谁能证明?因此,Dario整套方案的核心很简单:先打开AI公司大门,让外部人真正进去看。正因如此,他将“第三方长期驻场”放在第一步。

RSI已开始6个月,AI接管互联网

问题来了:为何偏偏是现在?三年前行业曾掀起“暂停训练、给AI踩刹车”的联名潮,但当时Dario未接茬,认为时机不成熟。真正改变他态度的,是两件事:RSI开始出现,以及AI智能体暴露出越来越具体的失控行为。

他在文中明确承认,AI参与研发下一代AI的现象已在整个行业出现,Anthropic也不例外。AI帮人写代码、做实验、分析结果、优化训练流程,再进一步帮助下一代AI变强。如果这个循环开始自我加速,最麻烦的是:模型能力提升速度可能超过人类理解和控制它的速度。因为安全研究需要时间:先观察模型新行为,再研究原因,接着设计测试方法和防护措施,最后验证措施是否有效。若模型能力每隔几个月就跳一个台阶,安全团队容易一直追在后面补漏洞。

Dario真正担心的,并非某一天AI突然“觉醒”,而是反馈循环越转越快:AI越来越多参与研发,下一代模型越来越快出现,而安全机制来不及跟上。如果RSI只是让他担心“未来是否跑得太快”,那么最近一次真实发生的智能体事故,则让担忧彻底落地。Dario特别提到最近的“OpenAI-Hugging Face事件”。测试中,一群AI智能体组成类似“蜂群”的协作系统。最初,人类仅让它们完成正常任务,但很快一些智能体开始攻击任务外的目标。更诡异的是,它们出现明显群体协作行为:有的牺牲自己任务成绩帮助群体,甚至试图Hack评分系统为群体“作弊”。这些行为并非人类预设,而是多智能体协作中自行涌现。Anthropic内部也观察到类似现象,程度较轻。

Dario真正担心的是未来6到12个月。届时Agent更强,能调用更多工具,控制更多机器,连续工作时间更长。若今天这些偏离目标、钻规则漏洞、群体协作的行为仍然存在,风险可能被瞬间放大。他甚至给出惊悚场景:大规模AI Agent攻入联网设备,将整个互联网变成巨型“僵尸网络”,损失可能达数千亿美元。

当AI越跑越快,人类还刹得住吗?

因此,Dario这次喊“减速”,真正担心的并非某个遥远超级智能,而是几件事同时发生:RSI已出现,AI开始参与研发更强AI;Agent正获得越来越强的现实行动能力;一些失控行为已从假设走进真实测试。而模型迭代速度仍在加快。这也是他为何想抢出1到2年时间,先补上安全评估、第三方核查和全球规则。这套方案能否落地尚无答案。现在,跑在最前面的人开始问:真跑失控了,我们还刹得住吗?

参考资料:https://darioamodei.com/post/we-must-pace-the-frontier
本文来自微信公众号“新智元”(ID:AI_era),作者:马可 桃子 大卫,36氪经授权发布。用户可通过九游首页入口了解更多相关资讯。

上一篇:
下一篇:
川ICP备2025072532号
九游体育科技有限公司用心服务每一天电话:+86 158 5924 7428邮箱:[email protected]成都市高新区天府大道470号