专访|从AI巨头离职的顶级人才:人类正变成最慢一环,但让AI“慢下来不是好办法”

红星新闻 2026-09-24 12:58

人工智能究竟应该踩下刹车,还是继续加速?过去两周,这场争论突然从AI安全研究圈冲到了硅谷中心。

先是曾在OpenAI和Anthropic工作的27岁研究员雅各布·考克森辞职,公开称头部AI公司正在“拿我们的命赌博”。随后,Anthropic首席执行官阿莫代伊呼吁控制前沿AI能力增长速度,OpenAI首席执行官奥尔特曼、马斯克等也对加强外部评估、放慢发展步伐表示支持。

现实很快显露出另一面。9月19日,就在阿莫代伊公开呼吁行业“减速”约一周后,有报道称,Anthropic正在考虑推出新模型,以应对OpenAI带来的竞争压力。

曾在Google DeepMind工作7年的AI研究员里舒布·贾因(Rishub Jain)和前OpenAI治理研究员丹尼尔·科科塔伊洛(Daniel Kokotajlo)在接受红星新闻记者采访时,均表示:“减速”并不意味着离开。他们在离开“大厂”后,转向继续研究如何理解、监督和约束越来越强的AI系统。这应该是人类与AI关系发展中,最正确的路径和办法。

谁减速谁就掉队,慢下来不是好办法

抛开与AI发展之间的技术难题,人类面临一个更现实的难题:即使越来越多人认为放慢AI发展有利于人类安全,谁又愿意率先踩下刹车?

一份由1300多名前沿AI公司员工联署的公开声明指出,每家公司、每个国家都面临巨大的竞争压力,很难单方面放慢AI发展。一旦自己减速、竞争对手继续推进,就可能失去技术优势。Anthropic一边呼吁行业控制速度,一边又考虑推出新模型,或许恰好展示了这种矛盾。

9fa43ce07dc11fcb6ef0b9a097f38fa9.png▲DeepMind前AI研究员里舒布·贾因

曾在Google DeepMind工作7年的AI研究员里舒布·贾因(Rishub Jain)告诉红星新闻记者,到2026年,外部AI安全研究已经拥有更多人才、资金和关注,他也因此能够在大型实验室之外,把自己真正关心的研究推进到更大规模。

尽管担忧当前AI发展的速度,但当被问及是否仍然相信高级AI最终能够与人类目标保持一致时,他仍然给出了肯定的回答:“我相信我们能够对齐AI,并让它帮助人类。”

问题因此不是“慢下来”,而是在AI摆脱人类监管之前,人类能不能先建立起足够可靠的监督和判断机制,以在AI真的变得比我们更聪明、更快时,人类还可以判断它到底有没有做对?

AI已参与研发下一代AI,人类需要对齐

里舒布·贾因今年从DeepMind离职后,创办了一家专注AI安全、重点研究AI监督与评估的非营利机构。

对于“AI究竟已经发展到了哪一步”这个问题,贾因告诉红星新闻记者,近期频频出现的一个词——“递归自我改进”(Recursive Self-Improvement,RSI),就可以展现AI的进化阶段。简单来说,就是AI越来越多地参与改进自身,并进一步研发出能力更强的下一代模型。

美国人工智能公司Anthropic上周宣布,其大模型聊天机器人Claude已“主导”公司超过四分之一的人工智能研发工作。这是该公司计划定期公布的一组新指标之一,用来向外界展示AI正以多快的速度参与下一代模型的开发。

▲智能手机屏幕上的Claude应用图标,它是Anthropic开发的人工智能聊天机器人(图据视觉中国)

贾因很直接:“递归自我改进并不是某一天突然发生,实际上,我们早就看到它的迹象。”不过,他并不认为“自我改进”本身就是最值得害怕的事情。

“RSI本身并不是什么需要恐惧的东西。”他告诉红星新闻记者,“真正令人担忧的是,在我们还没有足够强的能力去对齐AI的情况下,AI发展的速度正在加快。”

贾因表示,人类如何与AI对齐,“这是一个眼下就需要认真考虑的现实问题,未来也一样。”

AI发展越来越快,人类必须快速评估结果

与AI对齐的一个重要方面,就是如果有一天AI已经比人类更擅长完成某件事,人类凭什么来判断它究竟做对了没有?

贾因认为,从模型对齐的角度看,AI能力超过人类本身并不是问题,真正的难点在于如何评估这些越来越强的系统。随着AI开始执行更复杂、更高级的任务,人类将越来越难判断其行为是否符合预期,因此“不能只依赖人类评估”。

依靠AI来监督AI,本身也存在新的难题。贾因表示,AI评估并不完美,“(如果)AI在特定领域发展出达到超人水平的系统,我们必须评估它们”,因为人类必须知道“它们到底有没有做对”。

他的团队目前尝试的一条路径,是把人类和AI各自的优势结合起来,用“人+AI”共同监督更强的AI。

2024年从OpenAI辞职的治理研究员丹尼尔·科科塔伊洛(Daniel Kokotajlo),目前担任AI Futures Project执行主任,该机构主要研究AI未来发展趋势。在与红星新闻记者沟通时,丹尼尔提供了他的一份AI未来发展趋势报告《AI 2027》白皮书。

43917b11b7d7076606bc8e52032f6430.jpg▲前OpenAI研究员丹尼尔·科科塔伊洛

《AI 2027》的一个核心设想,与贾因的担忧高度重合:AI开始大量参与研发AI,整个研发过程也不断加快,问题随之出现:人类可能成为整条研发链上最慢的一环,即AI一天完成的研究,人类可能需要好几天才能复核。

人类需要监督AI,如何独立监督面临障碍

为解决监督AI的问题,全球AI巨头提出“第三方评估”的方案,但第三方究竟怎样才能算真正独立?

贾因向红星新闻记者提供了一份9月18日发布的公开倡议,超过100名AI研究人员、学者和行业人士在倡议书中提出,第三方评估听起来简单,但真正做到“独立”并不容易。

9749073099db85535216abeb1355db07.png▲贾因(右一)与朋友们

倡议书签署者包括“AI教父”、诺贝尔物理学奖得主杰弗里·辛顿,以及前OpenAI AGI高级顾问迈尔斯·布伦戴奇(Miles Brundage)等。

首先,评估机构不能由被评估的AI公司拥有或控制,也不能因为得出对公司有利的结论而获得报酬。

更关键的是,外部评估人员究竟能看到多少。倡议提出,他们应获得接近企业内部高级安全人员的访问权限,不仅可以接触相关模型、数据和工具,还应能够直接与员工沟通。

如果评估发现问题,公司也不能利用保密协议阻止结果公开,更不能因为结论“不好看”而对评估方施压或报复。

这份倡议实际上把所谓“独立监督”落到了几个很现实的问题上:评估机构是否真正独立、能接触到多少内部信息,以及发现问题后能否不受干预地公开结论。

红星新闻记者 杨诗柔

编辑 罗天

审核 何先菊