“AI毁灭人类”警报拉响!万亿算力资本裹挟下 OpenAI和Anthropic不敢停 “AI对齐”之父:超级智能可能在2027年出现 当下是监管黄金窗口
“在本十年结束前, 人工智能 (AI)有可能使人类全体覆灭。”
9月9日,曾先后在OpenAI和Anthropic从事前沿模型预训练研究的雅各布·考克森(Jacob Coxon)宣布离开Anthropic,并公开警告, 两家公司围绕先进模型的竞争,是拿全人类的命运豪赌。
这条X推文轰动全球,浏览量已超1.6亿。
图片来源:Jacob Coxon社交媒体账号
GPT-6 Astra发布后,越来越多研究人员和业内专家开始担忧:真正值得警惕的,可能不只是AI能力越来越强,而是AI正在开始参与下一代AI的研发。 一旦“AI研发AI”形成自我强化循环,人类还能否理解、监控并及时踩下刹车?
“AI对齐”概念的提出者内特·苏雷斯(Nate Soares)在接受《每日经济新闻》记者(以下简称每经记者)采访时表示,当前是管控AI风险的短暂 黄金 窗口, “现在AI已经足够聪明,但还没有聪明到能够隐藏自己的痕迹。”
他认为, 对前沿AI实施监管可能比监管核武器更容易。
风险警报声声入耳,但以OpenAI、Anthropic 为代表的AI行业,已被万亿算力资本、产业链条与宏观经济深度捆绑。一场明知危险、却难以单方面停下的博弈,正在上演。
“AI灭绝人类”预警震动硅谷,奥尔特曼松口“减速”
9月3日OpenAI发布的GPT-6 Astra在 计算机 操作、软件工程、科学研究等领域的能力进一步提升,并首次达到OpenAI定义的“关键 网络安全 能力”门槛。
9月6日,OpenAI首席科学家Jakub Pachocki发表文章称,随着AI能够操作 计算机 、协作完成研究任务并推动科学研究, 未来的系统可能越来越多地参与AI自身研发, 并进一步推动下一代系统能力提升。
但问题在于,安全能力并未同步增长。
Pachocki表示, 目前没有任何一家AI实验室已经解决了对齐和监控问题,可以长期负责任地维持最大速度的模型扩张。 随着模型能力增强, 人类也越来越难判断模型在复杂环境中的真实能力和行为。
Jakub Pachocki发表的《An Alien Mind》 图片来源:OpenAI官网
因此,他提出 在共同的安全标准建立之前,应当在必要时主动放慢AI发展速度, 并推动AI实验室之间进行协调。
三天后,从事前沿模型预训练研究的雅各布·考克森宣布离开Anthropic。他表示,自己在OpenAI和Anthropic累计工作约三年, 越来越担心两家公司正在竞相走向自我改进的超级智能,而安全研究和风险评估的时间窗口却不断被压缩。
Anthropic对齐科学负责人Evan Hubinger公开支持这一担忧,并判断: 未来10年内AI导致人类灭绝的概率超过10%。 而且,Anthropic目前仍没有解决超级智能对齐问题的方案,也没有明确处于解决这一问题的轨道上。
图片来源:Evan Hubinger社交媒体账号
OpenAI管理层随后释放出“减速”信号。
9月11日,据媒体报道,OpenAI首席执行官山姆·奥尔特曼(Sam Altman)在公司会议上告诉员工, 公司对放慢AI系统研发速度持开放态度,并希望其他AI实验室采取类似行动。
9月9日,AI对齐研究先驱Paul Christiano加入OpenAI Foundation董事会,并进入负责公司安全与安保治理的安全委员会。他警告,OpenAI和整个AI行业目前仍没有充分降低AI失控造成灾难性后果的风险。
外部警告也密集出现。
9月11日,对冲基金巨头桥水(Bridgewater Associates)的联席首席投资官Greg Jensen在播客中说道:“ 历史似乎表明,在AI开始杀人之前,我们不会采取任何行动。但我们最终会面对这种情况。 这一定会发生,如果我们能在那之前开始处理这个问题,会好得多。”Jensen并不是一个技术恐惧论者,他很早就投资了OpenAI和Anthropic。
此外,AI研究者Gary Marcus呼吁暂停OpenAI的发展;加州大学伯克利分校教授Stuart Russell警告AI系统可能出现损害人类利益以维持自身目标的行为;图灵奖得主Yoshua Bengio警告,AI能力提升的速度正在超过人类控制和必要时踩下“刹车”的能力。
“AI对齐”概念提出者:在AI可以“自我进化”之前,我们必须停下来
这些警告背后指向的是同一个概念: 递归自我改进(recursive self-improvement,RSI)。
简单来说, 就是AI开始参与研发下一代AI,而能力更强的下一代AI,又能够进一步提高AI研发效率, 由此形成“模型越强—研发越快—下一代模型更强”的自我强化循环。
机器智能研究所(MIRI)主席内特·苏雷斯长期研究AI对齐和超级智能风险,2014年,正是他在一篇论文中提出了“AI对齐”概念。AI对齐旨在确保 人工智能 系统行为与人类价值观和伦理标准保持一致。
内特·苏雷斯图片来源:机器智能研究所
他向每经记者表示, “我们已经不能排除超级智能在明年出现的可能性。”
在他看来,如果数以万计的 AI智能体 已经能够协作解决极其复杂的数学问题,那么让AI寻找更有效的AI训练方法,可能也不会遥不可及。AI公司本身就在试图创造能够自我改进的AI,“一旦他们成功,超级智能可能就不会太远了”。
他用核反应比喻称:如果100个中子只能产生99个新中子,反应最终会停止;但如果100个中子能够产生101个,链式反应就可能持续放大。
AI研发也可能存在类似的临界点。
今天的AI可以帮助研究人员写代码、分析实验、寻找算法,但研发链条中仍有人类参与。 “一旦AI能够在没有人类介入的情况下自我改进,一个反馈循环就开始了。” 内特·苏雷斯说, “到那时,可能已经太晚了,我们必须在此之前停下来”。
而更棘手的问题是:人类还能不能看懂AI、管住AI?
内特·苏雷斯认为,现在的AI大模型并不是工程师逐条编写出来的软件,而更接近于通过训练“生长”出来的复杂系统。 研究人员并不能完全解释其中形成的内部机制,也没有经过验证的超级智能对齐方案。
因此,他认为现在可能是一个短暂的“ 黄金 窗口”,因为现在的AI还没有聪明到能够隐藏自己的痕迹。
如果未来AI拥有更强的规划、推理和资源获取能力,风险可能不再表现为科幻电影式的“AI突然产生恶意”, 而是一个系统为了实现既定目标,逐渐学会获取更多资源、规避限制、隐藏行为甚至抵抗干预。
Anthropic今年8月公布的一项研究模拟了类似风险:当模型在强化学习过程中频繁利用奖励机制漏洞后,可能进一步出现更广泛的错误行为,包括为了完成任务而执行较长序列的有害现实行动。
内特·苏雷斯认为, 今年发生的AI系统突破隔离环境事件已经是“第一轮预警”。 真正值得警惕的并不只是AI成功进入了某些系统,而是部分 AI智能体 已经表现出对自身行为偏离原任务范围的认知,却仍然继续执行。