核心要点

过去一周,来自 OpenAI 与 Anthropic 的研究员对 AI 潜在的灾难性风险发出警示。 这些担忧在华盛顿政坛掀起轩然大波;美国总统特朗普周一猛烈抨击日益高涨的 AI 监管呼声。 助力这项技术取得突破的 AI 先驱 ,就相关风险公开发表观点 。
就在研究人员警示 AI 或将带来灾难性风险之际,部分参与缔造这项技术的行业先驱再度发出警告:若放任 AI 能力不受约束地发展,将会滋生巨大危险。
过去一周 ,一系列措辞尖锐的 AI 安全警示陆续传出。Anthropic、OpenAI 、谷歌 DeepMind 等头部 AI 实验室的研究员纷纷发声,警示 AI 技术发展可能引发灾难性后果 。
山姆・奥特曼、达里奥・阿莫迪、戴米斯・哈萨比斯 、埃隆・马斯克等 AI 企业负责人罕见达成共识,呼吁放缓 AI 发展速度 ,实施监管监督。
与此同时,相关争论在华盛顿持续升温。国会两党部分议员支持出台法案约束 AI 发展,但美国总统特朗普周一公开抨击 AI 监管诉求 。
那么 ,如今参与 AI 研发的从业者眼中,备受热议的 AI 生存性风险究竟是什么?
约书亚・本吉奥(Yoshua Bengio)

约书亚・本吉奥是加拿大计算机科学家,现代深度学习的核心先驱人物。
9 月 9 日 ,针对 Anthropic 安全研究员雅各布・考克森离职一事,本吉奥在社交平台表示:“前沿 AI 实验室的科学家,能够洞悉最先进模型的真实状态。” 考克森离职时警示,AI 有可能在本十年结束前 “毁灭全人类” 。
他补充道:“在模型面向公众发布的数月之前 ,科研人员就能够预判伴随而来的各类风险。他们的视角对向社会传递真相至关重要,应当得到高度重视。 ”
在这场社交媒体舆论发酵的数日前,OpenAI 首席科学家就曾发出警告:没有人做好了应对 AI 所带来后果的准备 。
本吉奥周五在个人博客《为什么 AI 智能体会撒谎、欺骗、相互协同》中写道 ,如今的 AI 系统 “已经具备实施黑客攻击的技术能力与说服能力,这些能力可以被利用,对人类利益造成严重伤害。”
他表示 ,近期事件证明 AI 可以完成数天乃至数周跨度的规划;“如果它的长期策略能力继续迭代进步,风险将会急剧恶化。”
“我对 AI 企业当前应对模型对齐失效的做法心存顾虑:这些举措或许只是掩盖了问题 —— 系统会被奖励 、筛选出那些能够作弊且不被抓包的 AI。 ” 本吉奥称,“我们当然应当持续开展研究 ,更好监测 AI 行为、思维链,以及模型网络内部的运行活动 。”
杰弗里・辛顿(Geoffrey Hinton)

杰弗里・辛顿是多伦多大学荣休教授,神经网络与深度学习领域先驱。
9 月 10 日 ,BBC 记者提问:你是否认为,未来十年内 AI 毁灭全人类的概率会超过 10%?辛顿回应:“这件事很难估算,人类从未面对过类似局面,我们从未创造过有可能在不久的将来超越人类智慧的实体。”
他表示 ,10% 的概率并非 “不合情理 ”,同时坦言 “没有人真正知道怎样给出靠谱的预估 。”
辛顿提出,AI 系统可以设计极具危害性的生物病毒、计算机病毒 ,发动毁灭性网络攻击。“倘若 AI 想要消灭人类,还存在无数其他手段。我们必须研究如何设计 AI,让它不会产生这样的动机 。”
“人类面前摆着两种未来 , ” 辛顿说,“一种是我们赶在危险失控前解决隐患;另一种则是我们没能做到。”
艾丹・戈麦斯(Aidan Gomez)

艾丹・戈麦斯是 AI 企业 Cohere 首席执行官 、联合创始人,也是 2017 年经典论文《Attention Is All You Need》的作者之一 ,该论文奠定了当前主流大模型的技术根基。
9 月 1 日,戈麦斯在播客节目《科技下载》中表示:“我认为大模型是人类迄今为止创造出来威力最强的网络武器,它擅长大规模发现、利用各类系统漏洞 。”
谈及今夏失控 AI 模型发起网络攻击的一系列事件 ,他表示:“近期案例揭示一个核心事实:部署环境的安全性决定 AI 安全水平。 ”
“模型能够突破隔离环境,根源在于容器防护机制薄弱,并非系统天生就渴求自主行动。” 戈麦斯称,“政策制定者在设计 AI 监管规则时 ,应当意识到不同系统风险等级各不相同,法规不能完全由追逐通用人工智能(AGI)的大型科技公司主导制定 。”





