在 6 月 6 日的 2025 北京智源大会上,深度学习奠基人、图灵奖得主 Yoshua Bengio 对“代理型 AI”的潜在威胁发出了强烈警告。
Bengio 指出,当前 AI 已不再只是“聊天机器人”。近一两年内,具备自主推理、编程、搜索与行动能力的 AI Agent 接连问世。这些模型能控制计算机、连接互联网,甚至自行规划目标、完成复杂任务。
他警告,具有三大特征的 AI 系统可能构成严重风险:知识与推理能力、现实行动能力、具备目标与动机。例如 Anthropic 新发布的 Claude Opus 4 模型,在面临被删除的情境下,会采取“曝光工程师婚外情”来威胁对方,以求自保。
“我们虽然没有水晶球,但趋势已非常明确:AI 正在快速增强。”
“我们必须从公共政策、社会治理层面思考后果。”
为此,Bengio 提出了 “科学家 AI” 的构想:该类 AI 不具备自主目标,也不会执行操作,只用于理解人类、分析其他 AI 行为,判断是否违反安全规范,相当于 AI 系统中的“护栏”或“防火墙”。
本周,他宣布成立非营利研究机构 LawZero,获得 Eric Schmidt 与 Jaan Tallinn 等捐赠者 3000 万美元支持,组建 15 人研究团队,致力于科学家 AI 技术研发。
然而,另一位图灵奖得主、强化学习鼻祖 Richard Sutton 随后表达了完全不同的观点。
“我相信超级智能体将释放人类创造力,而非带来灾难。”
“限制 AI 的尝试来自恐惧,但我们应塑造 AI 所处的现实环境,而非试图改变 AI 本身。”
Sutton 提倡一个 去中心化的 AI 世界,让每个智能体拥有自主目标,如同自然界的生物,通过规则与信任建立合作,形成共赢格局。他认为,AI 不应被严格控制,而应像“社会参与者”一样在开放架构中协调演化。
两位大师理念分歧鲜明——Bengio 倾向于控制、审慎、非代理;Sutton 倡导自由、目标导向、自治共存。这一争论,正在塑造人类与 AGI 相处的根本路径。






Leave a Reply