← All stories

Anthropic安全负责人认为AI导致人类灭绝的风险超过10%

Jacob Coxon已从Anthropic辞职,指称AI公司在存在安全风险的情况下,仍争相开发可自我改进的系统。Anthropic安全负责人Evan Hubinger公开表示,他估计未来十年内AI杀死所有人类的概率超过十分之一。

为何重要

一名高级研究员的辞职和一位安全负责人的公开声明,凸显了人们所感知的前沿模型风险与已承认尚无完整对齐方案之间的落差,也加大了将安全主张转化为实际控制措施的压力。

Tech Trends Today publication

有何变化

据The Verge报道,Anthropic研究员Jacob Coxon已辞职,称Anthropic和OpenAI正争相开发可自我改进的AI,却没有充分的安全保障。负责领导Anthropic一个安全团队的Evan Hubinger表示,他个人估计,未来十年内AI“可能杀死所有人类”的概率超过十分之一;他还说,Anthropic目前尚未制定确保先进AI保持安全并与人类目标一致的方案。

为何重要

厂商的安全表态已不足为据。如果一家实验室自己的安全负责人都说其方案尚未完成,那么每一项雄心勃勃的部署都应追问一个更严肃的问题:模型投入生产使用前,具体有哪些发布门槛、访问限制和监控规定?

我们的展望(基于信息的推测):未来6—12个月,较可能出现的结果是对部分前沿能力实施准入控制,而不是全面停止开发。这可能让最强大的功能更晚进入生产环境,使用条件更严格,也需要投入更多工程精力。现在就按可替换性、可审计性和人工审批原则构建系统的团队,如果访问规则收紧,将有更大的调整余地。重点并非要因一项个人概率估计而恐慌,而是不要再把前沿模型的可用性当作永久不变的产品保证。

历史参照

在1975年阿西洛马会议上,科学家们认为,新兴的重组DNA研究需要严格管控。两者的相似之处在于:最了解这种快速发展能力的人认为,后果可能极其严重、但尚存不确定性的风险,要求改变开发的推进方式。

这一回应随后落实为具体措施。美国国立卫生研究院于1976年发布重组DNA指南,采用风险分类、隔离要求以及对特定研究的禁令;后续证据支持放宽其中部分管制。AI与此存在实质差异:其风险包括自主行为、网络能力和广泛部署,而非实验室暴露风险。不过,其中仍有一条坚实的经验:只有当警告转化为可衡量的门槛、可执行的控制措施,以及根据经验作出的修订,才能形成有效的治理。

影响可能如何传导

如果Anthropic将Hubinger公开披露的规划缺口转化为评估、发布门槛或访问限制,那么在先进能力交付客户之前,产品团队可能需要开展更多测试并接受更多监督。企业用户届时可能更晚获得这些能力,并面临分阶段开放、监控或更窄的使用条款。

如果保障措施并未实质性拖慢部署,或竞争厂商以较少限制提供替代能力,这条传导链就可能中断。真正的检验在于,这种担忧是否会改变产品运营方式。

影响评估

Anthropic短期内面临压力。Coxon的辞职和Hubinger的言论,使其安全方针能否落实为影响发布的决策这一问题更加突出。

未来6—12个月,前沿竞争对手将面对相互交织的激励。Anthropic若放缓部署或施加更多限制,可能让其他厂商获得速度优势,同时也会提高外界对竞争对手展示自身控制措施的期待。

在同一时期,企业买方面临取舍。针对特定能力的访问控制和监控,可能让部署风险更清晰,但也可能限制或延迟对先进功能的访问。

情景

最可能。 如果前沿实验室以可衡量的保障措施回应公众和内部压力,同时仍允许开发继续,未来6—12个月将出现更明确的评估和部署控制,商业进展则会持续。这是基准情景,因为报道描述了一场正在进行的竞争,同时也指出尚无完整的对齐方案。更有力的信号包括针对特定能力的门槛、分阶段访问,以及拥有明确发布权限的安全团队。如果发布的模型能力持续增强却没有附加新条件,这一判断的可信度将下降。

上行。 如果企业和外部机构将笼统的危险主张转化为可测试、针对特定能力的规则,研究便可在更清晰的隔离、访问和审查门槛下继续。买方将更清楚地了解一个系统能做什么、可在哪里运行,以及配套有哪些控制措施。独立评估和具体的访问规则会增强这一走向;缺乏执行力的模糊承诺则会削弱它。

下行。 如果竞争压过可执行的保障措施,而可自我改进的AI研究加速,可能出现更多因安全担忧而离职的人员,客户也许不得不自行制定限制性采购规则。这将有利于能够投入资金建立内部风险控制的组织,并使规模较小的采用者更难具备评估前沿系统的实际能力。明确且得到执行的部署门槛将打断这一走势。

接下来关注什么

  • Anthropic发布安全、对齐、评估或部署方案,其中包含可衡量的门槛、决策权、访问限制或发布门槛。
  • 先进模型转为分阶段提供、受限使用、受到监控,或以安全评估为前提。
  • 出现更多与安全相关的离职事件,研究人员援引尚未解决的规划或部署做法。
Sources (4)
  1. The VergeMore than 1 in 10 chance AI ‘could kill all humans,’ says Anthropic safety lead after colleague quits
  2. nature.comAsilomar conference on DNA recombinant molecules
  3. ncbi.nlm.nih.govGenetically Engineered Crops: Experiences and Prospects — Genetically Engineered Crops Through 2015
  4. ncbi.nlm.nih.govField Testing Genetically Modified Organisms: Framework for Decisions — Historical Overview of Nucleic Acid Biotechnology

评论

暂无评论。