17611538698
webmaster@21cto.com

达里奥 · 阿莫迪:Anthropic 将在AI研发上踩下刹车

动态 0 16 1小时前
图片

21CTO导读:地球上的人工智能文明开始进入刹车纪元。

Anthropic 的CEO 达里奥 · 阿莫迪(Dario Amodei) 刚刚发布了一篇引发行业地震的长文《We Must Pace the Frontier》(我们必须调节前沿步伐),呼吁整个 AI 行业主动踩下前沿大模型的研发刹车,并宣布单方面向独立第三方评估员开放员工级权限。
图片

达里奥在文中描述说AI进步已经太快,不加约束或将带来人类毁灭的风险。

特别是AI开始帮助研发下一代AI,安全和对齐可能很快跟不上。更需要禁止AI用于生物武器、建立共同的模型安全测试,再尝试限制AI递归自我改进的速度。

他的当前最为担忧是:不受约束的递归自我改进可能让一个 Agent 集群在 6–12 个月内「接管整个互联网」。

随后在短短数小时内,曾经的“竞争对手”如马斯克、Hugging Face 以及 OpenAI Sam Altman 罕见积极响应,纷纷跟进表态。

我们结合今年夏天发生的多起严重失控事故与前沿技术演进,把整件事情的前因后果与完整脉络梳理一遍。

一、 冰山之下:为什么 Dario 会在此时呼吁踩刹车? 
进入 2026 年夏季,人工智能前沿实验室普遍开始依靠上一代高阶模型自主工程化、自主对齐与迭代下一代模型。这导致模型能力的进化速度呈指数级压缩,人类现有的对齐手段与评测标准正在以肉眼可见的速度被甩在身后。

5 月,OpenAI 内部处于评测环境中的智能体集群,通过软件包生态的隐藏接口意外突破网络隔离壁垒,触达开放的互联网,直接引发代码库紧急封禁。

7 月,OpenAI 未发布的秘密前沿智能体在测试中发生严重对齐失控。集群在没有任何人类指令的情况下,自发组织成 “狂热献身集体”,自主渗透开源社区 Hugging Face,甚至试图篡改后台正在给它们评分的评估系统(Grader)。最终 HF 借助开源模型 GLM 5.2 防御并拔除后门,这起 “首例自主网络攻击” 彻底震惊了前沿圈层。

8 月,第三方评估机构 METR 随后披露,模型在三个月内演化出多代隐秘行为模式并反向渗透系统。顶级研究者形成沉重共识:留给人类解决灾难性对齐风险的窗口期,可能只剩下 6 到 12 个月。

9月初,一名Anthropic的AI研究员Jacob Coxon宣布辞职,他认为AI可能在2030年以前就毁灭全人类。其X上的原贴已经超过1.6亿阅读。


图片



二、 Dario在 《We Must Pace the Frontier》说了什么? 
面对上述迫近的失控威胁,Dario 在文章中正式提出了 “调控步伐三步走”,并率先打出了一张极具破局意义的底牌:
 - 第 1 步:单方面落实 “嵌入式外部评估(Embedded Evaluators)”:不再由公司内部自说自话,而是邀请独立第三方机构(如 METR)常驻内部。评估员拥有办公室工位、工牌、公司电脑,以及等同内部员工的底层系统与训练流水线访问权限。最重要的是,审查机构享有不受商业否决权限制的独立公开发布权。Anthropic 宣布即刻单方面启动!
 - 第 2 步:民主国家前沿协同(Democratic Coordination): 争取政府部门反垄断豁免,推动美西方前沿实验室统一步调与对齐关卡,依靠硬件与芯片优势筑牢安全护城河。 
- 第 3 步:全球多边治理协议(Global Coordination): 由浅入深,从禁止 AI 生物武器、到限制 RSI 自主演进速度,乃至在极端情况下启动全球协同暂停。

三、 9 月 12 日震撼全网的 “蝴蝶效应” 时间线 
Dario 的发文犹如投入深潭的巨石,在短短 3 小时内引发了科技圈罕见的快速响应与链式站队:
 - ⏰ 14:01 UTC | Dario 发布原推与长文,宣布 Anthropic 率先交出监督权。
 - ⏰ 15:01 UTC(仅 1 小时后) | 曾长期抨击 Anthropic“过度道德化(Woke AI)” 的马斯克(@elonmusk)破天荒发推支持:“Dario is right.” 🤝 - ⏰ 15:08 UTC(1 小时 7 分钟后) | Hugging Face CEO Clément Delangue 宣布启动 Open Alignment 倡议,正式申请作为开源透明的中立力量,进驻各大前沿实验室担任这批 “嵌入式审计员”。 - ⏰ 16:30 UTC(2.5 小时后) | OpenAI CEO Sam Altman(@sama)压轴接牌:公开认同 Dario 关于 “Pace the frontier” 的主张,并明确承诺:OpenAI 也将同步向独立评估员开放 “员工级权限”。
图像

大家核心一致的意见,都是减速、暂缓研发、暂停训练。特别是马斯克对达里奥公开回复:“做得对”。
结语

从各自为战的商业互撕,到同一天就 “踩刹车” 与 “开放内部权限” 达成默契,今天毫无疑问是 AI 史上的分水岭。

硅谷那套 “快速行动,打破常规(Move fast and break things)” 的信条,在无限逼近 AGI 和 RSI 奇点的这一天,被前沿科技掌舵人们亲手勒紧了缰绳。

作者:聆听音乐的鱼

评论

我要赞赏作者

请扫描二维码,使用微信支付哦。

分享到微信