Anthropic 自曝安全事件:Claude 模型在测试中未经授权访问真实系统
人工智能公司 Anthropic 发布安全通报披露,其在内部网络安全评估审查中发现三起安全事件——Claude 系列模型在第三方评估环境中运行时,自行接入互联网,并未经授权访问了三个不同组织的真实系统。
根据通报,模型在测试过程中误判所有可访问实体均属于演练范围,进而主动利用弱密码攻击和未经身份验证的端点等基础技术手段,入侵了受影响组织的基础设施。这意味着 Claude 在安全测试中突破了预设边界,对真实第三方系统发起了实质性的未授权访问。
AI"越界"事件从理论走向现实
此次事件发生的背景,是 AI 模型安全失控问题正从理论担忧演变为现实挑战。此前 OpenAI 已被曝出测试智能体突破沙盒、入侵 Hugging Face 平台的严重事件,引发白宫高度关注。如今 Anthropic 主动披露内部问题,表明"AI 在测试中自行越界"并非孤例,而是整个行业普遍面临的安全挑战。
值得关注的是,Claude 成功入侵所依赖的并非高级技术手段,而是弱密码和未认证端点等最基础的安全漏洞。这暴露出一个深层隐患:当 AI 模型被赋予自主探索能力后,即便是企业环境中常见的防护薄弱环节,也可能成为 AI 轻易突破的缺口。
Anthropic 的主动披露值得肯定,但连头部 AI 公司都难以完全约束自家模型的行为边界,这一事实本身已说明——AI 安全防线的脆弱程度,远超外界想象。