近日,先后效力于OpenAI和Anthropic的顶尖技术人才雅各布•考克森宣布离职,并在社交媒体留下一句刺耳的临别语:“他们正在拿我们的命赌。”与此同时,美国多家人工智能巨头也公开表示,在安全风险得到合理控制之前,应采取措施放缓相关研发。
9月17日,一场约两小时的人工智能风险圆桌辩论中,四位业内人士围绕超级智能是否会失控以及当下该停还是该继续推进AI发展进行讨论。
红星新闻近日专访了这场辩论中的关键声音之一——人工智能安全、网络安全与数字取证领域的计算机科学家、美国路易斯维尔大学副教授罗曼·扬波尔斯基,以及加州大学伯克利分校计算机科学教授、人工智能教科书《人工智能:一种现代方法》的作者斯图尔特·拉塞尔,询问他们对超级智能失控风险、研发是否该叫停,以及现有安全测试的看法。
现实:控制不住比人更聪明的AI
对策:先暂缓“用AI造更强AI”
在圆桌辩论中,扬波尔斯基的核心论点是:控制超级人工智能在原则上很难成立。因为“超级人工智能”被定义为在所有的认知任务上超过人类,训练它的人最终会比它“笨”。同时,他尤其警惕“递归自我改进”(Recursive Self-Improvement,RSI),即用更强的AI去研发下一代AI,例如用GPT-6去造GPT-7。他认为,人工智能的能力可能因此在数日到数周内被指数级拉高。

▲罗曼•扬波尔斯基
美国人工智能公司Anthropic上周宣布,其大模型聊天机器人Claude已“主导”公司超过四分之一的人工智能研发工作。这是该公司计划定期公布的一组新指标之一,用来向外界展示AI正以多快的速度参与下一代模型的开发。
如今,各大实验室都在谈论放慢研发、增加安全测试。扬波尔斯基认为,安全测试对普通AI工具有用,但解决不了超级智能的控制难题:测试能抓住你预想到的故障,却无法保证测出因人类智力边界而想象不到的故障。
扬波尔斯基在接受红星新闻记者采访时表示:“我认为首先停下来的一件事,就是用越来越强的AI去造更强的AI,尤其是‘递归自我改进’。”他说,正是在这一环节,人类可能失去对AI的有效控制。
扬波尔斯基表示,一旦出现具备人类水平并能从事AI研究的通用人工智能,“递归自我改进”就可能把原本需要数十年的进展压缩到数月、数日甚至更短。
加州大学伯克利分校计算机科学教授斯图尔特·拉塞尔则表示出忧虑,称要永远掌控比人类更强的实体非常困难。因此,核心问题在于“不要投入数万亿美元,去开发一种极有可能导致全人类灭亡的东西。”
现实:放慢AI开发仍是以高速冲向悬崖
对策:与核能监管对齐
拉塞尔在接受红星新闻记者采访时表示,企业间的激烈竞争使它们更专注于提升系统能力,却在安全问题上偷工减料:“正如我们在与OpenAI相关事件中所见,这些企业已开始失去对自身系统的控制。迄今为止,政府却尚未采取任何有效措施来强制要求确保安全。”

▲斯图尔特•拉塞尔
他认为,当前前沿人工智能的发展速度,已经超过企业与政府评估、控制这些系统的能力。仅仅放慢脚步并不够:“放慢开发速度,这只是在以每小时60公里的速度冲向悬崖,而不是以每小时100公里冲过去。”
拉塞尔更倾向从源头解决问题,而不是事后补救。他主张,开发者必须向监管机构提供科学上充分的证据,证明系统不会出现不可接受的行为。除非能预先证明设计安全,否则这类系统根本不应被制造出来。
谈及失控风险,拉塞尔将AI与核能做了对比:“核能监管往往要求将核电站安全壳的失效风险控制在每年千万分之一以内,而他们能达到这一标准,因为该系统由人设计、物理原理清晰。人工智能开发者往往不是在“设计”系统,而是在“培育”系统,他们并不完全理解其内部机理,因而难以满足同等要求。”
他补充道:“这不能成为降低监管标准的理由。监管机构仍应要求提供科学充分的证据,证明风险处于可接受范围;给不出证据,就必须推倒重来,去做内部机理清晰、可控的系统。”
谈及“OpenAI智能体入侵Hugging Face事件”时,拉塞尔说:“要知道,OpenAI已汇聚了全球顶尖的人工智能与网络安全专家。别处未必还有一群远比他们更聪明的人,能提前预警并处理好这类事件。这说明现有防护已经吃力。与此同时,人类还在主动把互联网、生物实验室、机器人和武器系统接到AI上。”
“归根结底,重要的是我们能否在开发出具有接管能力的AI之前,先针对失控问题拿出一套站得住脚的解决方案。”拉塞尔说,他对这一点并不乐观,这也是他强调必须监管的原因之一。
红星新闻记者 周月潇
编辑 邓旆光
审核 何先菊