引言:用密码驯服超级智能?
2025年8月,一项发表在arXiv上的论文《Governable AI: Provable Safety Under Extreme Threat Models》提出了一个大胆的构想:用密码学机制构建一个AI无法突破的”治理外壳”。研究者王东林等人认为,面对具有极端动机和无限智能的AI,传统的安全方法——模型增强、价值对齐、人工干预——都存在原则性局限。唯有基于”计算不可行”的密码学保障,才能在极端威胁模型下提供”可证明的安全”。这一方案引发了深刻的哲学追问:治理的最高形式,究竟是铁笼般的控制,还是无形的引导?
可治理AI框架:密码学的铁笼
GAI框架由三个核心组件构成:规则执行模块(REM)、治理规则和可治理安全超级平台(GSSP)。REM是一个完全确定性、简单可靠的规则执行引擎,它执行由治理规则定义的底线;GSSP则提供端到端的防篡改、防绕过和防伪造保护。三者共同构成一个”AI无法突破的牢笼”——即使在最极端的威胁模型下,AI也无法绕过或篡改治理规则,因为破解密码学保障在计算上不可行。
这一框架的哲学承诺是:安全来自外部强制,而非内在善意。AI不需要”想要”遵守规则,它只需要”无法”违反规则。
霍布斯与利维坦:安全来自不可抗力
GAI框架的精神内核与霍布斯的政治哲学高度同构。霍布斯认为,在自然状态下,人类处于”一切人对一切人的战争”中,唯有通过一个不可抗拒的利维坦——主权者——才能确保和平与安全。利维坦的力量不在于让人们”愿意”守法,而在于让人们”无法”违法而不受惩罚。
GAI框架中的GSSP就是AI世界的利维坦:它不依赖AI的善意或对齐,而是通过密码学的”暴力”确保合规。在霍布斯看来,这种外部强制的安全比任何内在动机都更可靠——因为即使在最坏情况下(AI极度聪明且充满敌意),密码学的数学保障仍然有效。
道家”无为而治”:另一种安全想象
然而,道家哲学提供了一种截然不同的安全想象。老子说:”太上,不知有之……功成事遂,百姓皆谓我自然。”最好的治理不是让人感受到控制的存在,而是让人根本意识不到被治理——一切自然而然地运行。
在AI治理语境下,”无为而治”并不意味着放任不管,而是设计一种系统,使合规成为AI运作的自然路径,而非需要被强制执行的约束。就像水流自然遵循重力——不是因为它被强制”对齐”了重力方向,而是因为遵循重力是它最自然的运动方式。
这种思路的吸引力在于:铁笼式的治理可能引发”越狱”的冲动——正如最严厉的监狱总会催生最精巧的越狱计划。而”无为而治”的设计思路则试图消除”越狱”的动机本身——当合规是阻力最小的路径,违规就不再是需要被防范的选择。
铁笼与流水:能否兼得?
GAI框架的密码学铁笼与道家的无为而治并非绝对对立。最理想的AI治理可能需要两者兼备:密码学机制提供不可突破的底线(利维坦的保障),而系统设计使合规成为默认路径(无为而治的优雅)。正如堤坝与河道的配合——堤坝确保洪水不泛滥(底线安全),而精心设计的河道让水流自然归入正途(无为而治)。
但这里存在一个深层张力:密码学的”不可突破”意味着规则的”不可修改”——而AI技术的发展速度远超密码学协议的更新周期。当治理规则需要与时俱进时,铁笼的坚固反而成了僵化的代价。老子警告:”天下多忌讳,而民弥贫;法令滋彰,盗贼多有。”过度的控制可能适得其反。
结语:安全的多重面孔
面对超级智能的潜在威胁,我们需要的或许不是在”铁笼”与”流水”之间二选一,而是在两者之间找到动态平衡。霍布斯的利维坦提供最坏情况下的安全保障,道家的无为而治提供长期可持续的治理智慧。密码学可以铸造不可突破的锁,但只有理解水流之性的治理者,才能决定锁该锁在哪里。
参考文献
- Wang, D. et al. “Governable AI: Provable Safety Under Extreme Threat Models.” arXiv:2508.20411, August 2025.
- Hobbes, T. Leviathan. 1651.
- 老子.《道德经》第五十七、十七章.
- Tegmark, M. “Provably Safe Systems.” 2023.














No comments yet