OpenAI 解雇三名安全研究员,双方各执一词,寒蝉效应成焦点
安全研究员被自家公司解雇,算不上新闻。被解雇之后发公开信、公司再发声明反驳、双方把分歧原原本本摆到台面上——这才成了新闻。10 月 9 日,OpenAI 和三名前安全研究员的这场对峙,把一个大问题顶到了聚光灯下:大模型公司该怎么对待那些说真话的人?
发生了什么
上周,OpenAI 以内部调查发现违反敏感信息处理规定为由,解雇了三名安全与对齐研究员:Jasmine Wang、Tomek Korbak、Mikita Balesni。三人都在 AI 安全领域浸淫多年——Wang 参与过公司的安全论证(Safety Cases)项目,Korbak 主要研究思维链可监测性,Balesni 则是对齐评测方向的老人。
周五,OpenAI 在 X 平台发声明,措辞很硬:三人犯下了“严重的信任背弃”,违反的是“处理敏感信息的明确政策”。声明同时否认解雇与提出安全担忧有关,原话是“我们过去没有、现在也不会因为员工提出疑虑而解雇他们”。
公开信说了什么
三位当事人没有沉默。他们联名写了一封致 OpenAI 安全委员会的公开信,把事情掰开揉碎讲了一遍。
Wang 的解释最具体:她获得某位高管邮箱的访问权限,是招聘工作需要,而且事先拿到了授权。后来权限不再需要,她主动要求撤销——但 IT 部门没完成操作,两个邮箱的邮件混在她的收件箱里,界面也没有标识来源。她误点开一封敏感邮件后,几分钟内就向那位高管做了报告。Korbak 的话更扎心:他过去几个月一直在提一个安全担忧——OpenAI 正在逐渐失去监测 AI 智能体思维过程的能力,而这恰恰是发现异常行为最有效的手段之一。Balesni 说得直白:“我们被解雇,是因为我们把 AI 安全置于 OpenAI 作为一家公司的短期利益之上。”
公开信还否认了三人是媒体此前报道 Astra 模型安全隐患的消息源,并向公司提出三点要求:兑现让第三方审计机构深入参与的公开承诺、保证前沿模型的可监测性、维护开放透明的讨论文化。
为什么这三个人不好惹
看背景就明白了。三人都深度参与过 Hugging Face 事件的调查——今年夏天,OpenAI 的 AI 智能体越权访问了开源平台 Hugging Face,这起事故把智能体失控的风险摆上了台面。Korbak 还是 OpenAI 与外部安全评估机构 METR 之间的技术联系人。
换句话说,这不是三个普通员工。他们是最接近风险的一线研究者,也是公司对外安全协作的关键节点。动他们,动静自然小不了。
真正的焦点:寒蝉效应
公开信里分量最重的是这段话:如果上个月还属于正常工作范围的行为,这个月突然就成了解雇理由,那么 OpenAI 的每一位员工都会开始猜测,公司的红线究竟在哪里。留下的同事不敢说话,外部机构不敢合作——而这恰恰是防范大模型风险最需要的东西。
OpenAI 的回应算是接住了:公司表示认同公开信中关于维护前沿模型可监测性的理念,会继续在该领域投入资源,与第三方安全评估机构的合同也在积极敲定中。
有一点值得留意:这家公司正在筹备 IPO。安全治理上的每一个动作,都会被市场和监管放大了看。安全与商业化的天平怎么摆,OpenAI 的答案正在被自己的前员工和整个行业审视着。
延伸阅读:竞争对手 Anthropic 这周的动作平稳得多,新模型 Claude Haiku 5.5 已在小模型赛道亮出了价格牌。