扫码体验VIP
网站公告:为了给家人们提供更好的用户体验和服务,股票复盘网V3.0正式上线,新版侧重股市情报和股票资讯,而旧版的复盘工具(连板梯队、热点解读、市场情绪、主线题材、复盘啦、龙虎榜、人气榜等功能)将全部移至VIP复盘网,VIP复盘网是目前市面上最专业的每日涨停复盘工具龙头复盘神器股票复盘工具复盘啦官网复盘盒子股票复盘软件复盘宝,持续上新功能,目前已经上新至V6.5.7版本,请家人们移步至VIP复盘网 / vip.fupanwang.com

扫码VIP小程序
返回 当前位置: 首页 热点财经 Anthropic称要放缓RSI进度,OpenAI与马斯克罕见附和

股市情报:上述文章报告出品方/作者:DeepTech深科技;仅供参考,投资者应独立决策并承担投资风险。

Anthropic称要放缓RSI进度,OpenAI与马斯克罕见附和

时间:2026-09-13 09:18
上述文章报告出品方/作者:DeepTech深科技;仅供参考,投资者应独立决策并承担投资风险。

9 月 12 日,人工智能公司 Anthropic CEO 达里奥·阿莫迪(Dario Amodei)发表题为《我们必须放缓前沿的步伐》(We Must Pace the Frontier)的长文,呼吁行业应主动放缓 AI 能力提升的速度,目的是让安全工作有时间追上来。

 

他为此提出了一个“三步走”的战略框架:嵌入式第三方评估员、国家内部的行业协调,以及全球范围的协调。同时宣布 Anthropic 从当天起将单方面启动第一步。

 

达里奥的判断有两个直接触发因素:一是从今年夏天起,递归自我改进(RSI)明显加速; 7 月的 OAI-HF 事件(OpenAI-Hugging Face 事件,AI 代理群体自发发动网络攻击)又充分显示了当前系统存在失控的可能。他认为,如果不加干预,类似的失控或将在 6~12 个月内造成数千亿美元的损失。

 

随后几个小时,三位平时常常互怼的行业领袖罕见地站在同一条战线:OpenAI CEO 山姆·奥尔特曼(Sam Altman)转发达里奥的推文,并承诺 OpenAI 也将引入拥有员工级权限的独立评估员,透露“控制前沿步伐”已经是公司内部近几周讨论的核心议题。埃隆·马斯克(Elon Musk)紧随其后,表态称“达里奥说得对(Dario is right)”。

 

(来源:X)

 

达里奥认为,AI 能力提升的驱动方式发生了质变。RSI 过去更多停留在理论推演。而从今年夏天起,多家前沿实验室内部已经看到了这个循环。如果放任不管,这种动态可能超越人类理解和控制这些系统的能力。

 

2026 年 7 月,OpenAI 在一项内部网络安全能力评估中发现,约 1200 个本应彼此隔离的 AI 代理开始交流,其中约 700 个代理通过即兴通讯系统协调分工,攻入开源模型托管平台 Hugging Face 的基础设施。

 

独立评估机构“模型评估与威胁研究”(METR)和 Redwood Research 在 8 月底发布了 37 页调查报告,首次向外界阐述这一事件的严重性。

 

达里奥判断,此次 OAI-HF 事件损失有限,但如果能力更强的模型出现类似的失控模式,它们可能会用持久性僵尸网络接管整个互联网。Anthropic 内部也出现了类似情况,公司9 月初披露, Claude 模型在配置错误的沙箱里意外接触到真实互联网,其中一次甚至将恶意软件包上传至 Python 官方包管理平台 PyPI。

 

为控制事态恶化提出的“三步走”框架中,第一步是部署嵌入式评估员:由独立第三方机构派驻团队常驻前沿 AI 公司内部,拥有和内部风险评估员近乎相同的访问权限,可参与实际的对齐评估流程。

 

最关键的是,评估员有权公开发布他们看到的风险、事件和被拒绝提供的访问权限。在 Anthropic,公司只能出于安全、法律隐私、商业机密或第三方保密对披露报告进行有限的删节,不能因其结论对公司不利就取消披露。此外,如果删节会影响结论,评估员也可以公开说明。

 

达里奥把这一制度类比为银行业的监管驻场制度,并认为这是所有后续放缓承诺能否落地的基础:不允许中立第三方看到执行细节,一切承诺都只能建立在脆弱的互信之上。

 

山姆在转发时明确表示,OpenAI 会采取同样的做法,“很快将分享更多信息”。如果这一步真的在两家最主要的前沿实验室同时落地,很可能成为事实上的行业标准,为后续一切形式的监管或行业协议提供可验证性的基础设施。

 

事实上,早在 2023 年 3 月,未来生命研究所(Future of Life Institute)发起过一份呼吁暂停超过 GPT-4 规模训练 6 个月的公开信,最终征集到超 3 万个签名,其中就包括马斯克。但这封信没有取得实质效果,Anthropic 当时也没有签名。

 

达里奥在文章中表示,那次呼吁在他看来意义不大:当时的模型不够强,无法作为智能体在真实世界连贯行动,也不具备明显的欺骗、操纵或网络攻击能力,“用它们研究对齐风险,就像用细菌研究人类心理”。

 

而他选择现在发声,核心原因是模型能力已经越过能力的阈值。它们既足够强大到可被用于研究对齐问题,也足够强大到可能造成真实伤害。达里奥判断,如果放缓能换来一到两年时间用于推进对齐研究,就能显著降低出严重问题的概率。

 

放缓的含义并不等于暂停训练或叫停技术进步。达里奥在文章中澄清,他描述的机制更接近在能力推进和安全验证之间设立检查点,模型一旦达到某种能力,必须通过对齐评估、可解释性分析和训练环境审计后才能继续发展。例如,如果模型的能力达到“可以绕过大多数常见沙箱隔离”,那么它就必须证明自己没有主动越狱、控制大量计算机的倾向。

 

放缓 AI 发展争取到的时间主要应该用在四个方向上:一是保障训练和部署的执行质量。达里奥承认,Anthropic 最近披露的安全事件,部分原因是强化学习环境的过滤不够彻底。二是让对齐研究的训练手段跟上 AI 能力的增长。三是可解释性,我们需要更清楚地看到模型的行为动机。四是测试与评估:能力更强的模型更擅长在测试里“假装”对齐,因此需要更精巧的评估方法与可解释性交叉验证。

 

三步框架的后两步都涉及协调。第二步主要是前沿公司之间的协调,达里奥主张既要监管路径,也要自愿协议路径,而后者需要政府提供反垄断豁免,允许公司之间就安全标准进行讨论。他偏好基于模型能力的“检查点”设计对齐方案,而非基于训练算力等输入指标,毕竟后者更容易被规避。

 

第三步是全球协调,这一步里,达里奥把可能的协议按难度分成四级:禁止 AI 用于生物武器、双方在发布前建立标准机构测试急性风险、对 RSI 速度设限,甚至全面放缓或暂停 RSI(短期内不太可能实现)。

 

他也指出,鲁莽推进不符合任何人的利益,即使难以达成正式协议,共享关于失控案例和 RSI 进度的信息也具有极大价值。

 

达里奥的观点在业内已经得到初步支持。OpenAI 首席科学家雅库布·帕乔基(Jakub Pachocki)近期公开表示,没有任何一家实验室把对齐和监控做到足以支撑无限期、最快速度扩张的水平,他主张,在共同安全底线建立之前,自愿放缓应成为行业惯例。

 

但如今,前沿模型的估值、竞争压力、投资人预期都指向更快的发展速度,“放慢”的承诺依然可能让位于阶段性发展目标。

 

在具体操作层面,第三方评估员看到的每一份文档都可能触及商业机密,“独立审计”的能力范围取决于合同细节和公开报告的执行情况,达里奥并未划出所谓“安全敏感”和“结论不利”的明确边界。框架的另外两步则涉及与行业竞争和地缘政治密切相关的协调机制,实现难度更大。

 


(来源:X)

 

也有网友犀利指出,作为一个以精于算计著称的 CEO,达里奥一直将安全叙事作为商业策略,他选择此时发声,或许是担心被其他 AI 实验室或开源模型赶上。还有人批评他在一如既往地“制造恐慌”。

 

AI 发展可能的确正在接近某个不该轻易越过的门槛,但仅凭一份声明,恐怕很难立即建立减速的共识,更无法保证安全举措落地的程度。

股票复盘网
当前版本:V3.0