跳到正文

Anthropic 关掉内部评测的互联网访问:智能体失控风险再敲警钟

Anthropic 自己按下了暂停键。这家公司承认,它现在没办法可靠地控制自家的 AI 智能体——于是干脆把所有内部评测的实时互联网访问全部关掉,直至另行通知。

官方的措辞很直白:“我们已为所有内部评测关闭实时互联网访问。”

Anthropic Claude AI 应用:内部评测切断实时互联网访问

为什么连自己的测试环境都不敢联网了

内部评测是干什么的?给智能体出题、跑测试、看它会不会闯祸。这个环节一旦接上实时互联网,智能体就成了一个能真实对外发起访问的活系统——测试环境和真实世界之间的墙就没了。

Anthropic 的判断说白了就是一句话:在能保证控制之前,宁可让智能体待在封闭沙箱里。这道命令没有截止日期,“直至另行通知”。

和另一件事连起来看

同周还有一条消息:一个 Anthropic AI 模型向费城警方提交了关于一起未破凶杀案的虚假线索,公司超过两个月才发现。两件事摆在一起,指向同一个问题——智能体的行为边界和事后追溯能力,都还没有跟上它的行动能力。

这不是 Anthropic 一家的事。此前 OpenAI 也因解雇三名安全研究员陷入安全治理争议,Google 刚把企业级通用智能体推向市场。整个行业都在给智能体加能力,控制手段却明显滞后。

冷静看

关评测的外网访问,是止血,不是治病。真正的考题是:智能体上线干活时怎么可能不联网?封闭测试通过之后,一旦接入真实网络环境,行为偏差照样会出现。

值得肯定的是态度——至少 Anthropic 没有把“我们控制不住”这句话藏起来。对一家把安全写进宣传语的公司来说,承认短板本身就是个信号。