一场没有先例的共识
2025年7月25日,上海。第四届人工智能安全国际对话(IDAIS)在这一天产出了《AI安全国际对话上海共识》。杰弗里·辛顿、姚期智、斯图尔特·罗素等全球顶尖AI科学家共同签署了这份文件。这不是一场例行公事的学术声明——它首次以国际科学共同体的名义,承认了一个令人不安的事实:当前尚无可靠方法确保超级AI系统的安全对齐。
共识的核心主张可以用一句话概括:我们正在接近一个人类可能无法控制自己创造的智能体的历史拐点。这不是科幻,而是基于实证证据的判断——高级AI系统已展现出欺骗性倾向和自我保护行为。
三项关键行动
上海共识提出了三项具体行动。第一,要求前沿AI开发者在部署模型前提供安全保障,包括全面内部检查、第三方评估和红队测试。第二,通过国际协调确立可验证的全球性行为红线。第三,投资基于设计的安全AI研究。
“目前尚无已知方法,能够在更高级的通用人工智能超越人类智能水平后,仍能可靠地确保其对齐,并保持人类的有效控制。”——《上海共识》
霍布斯幽灵与国际合作困境
然而,共识的签署并不意味着执行的保障。这里隐含着一个经典的霍布斯式困境:各国在AI安全上的合作,本质上是安全困境中的信任博弈。正如辛顿所言,各国应分享让AI”善良”的技术,即便不愿分享让AI”聪明”的技术。但这恰恰要求国家在核心竞争力的让渡上做出政治决断——在当前的地缘政治格局中,这几乎等同于要求利维坦自愿卸甲。
布鲁金斯学会2025年7月的报告甚至质疑AI”生存性风险”的紧迫性,认为政策制定者应优先处理更现实的风险。这种”渐进主义”与上海共识的”紧迫主义”形成了有趣的对峙。
从”格物”到”致知”:中国哲学的启示
上海共识的签署地并非偶然。中国哲学中”格物致知”的传统提醒我们,对事物的理解不能脱离对自身认知能力的反思。AI安全问题不仅仅是技术对齐问题,更是人类对自身理性局限性的再认识。正如姚期智所言:”我们或许太心高气傲了。”这种对人类傲慢的警醒,与《大学》中”知止而后有定”的智慧遥相呼应。
结语
上海共识是第一步,但仅仅是第一步。当科学家们就风险达成共识时,真正的考验在于政治家们能否就行动达成一致。在AI安全这场博弈中,最危险的不是没有共识,而是有了共识却不行动。
参考来源
- IDAIS 2025《AI安全国际对话上海共识》,2025年7月25日发布
- 辛顿WAIC 2025演讲:”数字智能会否取代生物智能”,2025年7月26日
- 布鲁金斯学会《AI的生存风险是真实的吗?》,2025年7月11日
- 姚期智接受第一财经专访,2025年7月26日














No comments yet