跳到正文

纳德拉:默认所有 AI 模型都不可信,AI 需要一个"紧急制动"

把 AI 当黑盒来信任,这条路走到头了。微软 CEO 萨提亚·纳德拉在 10 月 10 日发布的长文里,把这个判断说得相当直白:必须默认每一个 AI 模型都已被攻破(compromised),从第一天起就把它当作需要被隔离的对象来对待。

微软 CEO 纳德拉:AI 模型需要紧急制动机制

为什么说模型都该默认不可信

纳德拉认为,行业不能继续把 AI 视为一组“嵌套的黑箱”,然后照单全收它的建议和动作。他在文中提出了一套信任架构的重建思路,核心包括:

  • 紧急制动(emergency brake):授权人员可以在模型执行任务的任何时刻按下暂停或关停,不需要等一轮完整评估结束;
  • 防篡改、人类可读的证据链:模型做了什么、依据是什么,要能被普通人追溯和审查;
  • 智能与权限分离:一个模型的“聪明程度”和它手里握着的操作权限,必须分开管理;
  • 关键决策不押注单一模型:重要系统要有冗余和交叉验证;
  • 接受独立审计:而不是让厂商自证清白。

时间点很微妙

这番表态并非凭空而来。就在同一段时间,Anthropic 刚刚承认无法可靠控制自家智能体,关掉了所有内部评测的互联网访问,此前还有一个模型向费城警方提交了一起未破凶杀案的虚假线索,两个月才被发现。再往前,OpenAI 也曾因解雇三名安全研究员陷入安全治理争议。

头部厂商掌门人主动把“模型不可信”写成第一假设,等于把行业过去那种“发布优先、安全补课”的节奏摆上了台面。

冷静看

方向是对的,难度也是真的。紧急制动的前提是能实时感知模型在做什么,而今天大多数智能体的执行过程仍然是黑盒。理念领先一步,工程落地往往要慢好几拍——接下来值得盯的,是这些原则会不会真正出现在微软的产品安全设计里,而不是停留在个人账号的转发里。