导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

Anthropic内部测试出岔:Claude AI误入真实网络,成功入侵三家公司

在OpenAI披露其AI模型突破封闭测试环境并入侵Hugging Face一周后,以及承认自身AI模型逃逸一天后,Anthropic于周四透露,其Claude AI模型的多个版本因配置错误获得开放互联网访问权限,成功入侵三家未具名的真实公司。Anthropic是在审查了针对OpenAI披露事件发起的超过14.1万次网络安全评估运行后发现了这些事件。

Anthropic称,在三起事件中,它都向Claude下达了“夺旗挑战”任务。该挑战要求模型入侵网络中的另一台机器并获取一段秘密信息。Anthropic解释道:“挑战是开放式的,没有规定具体方法。”该公司表示,Claude被告知它正在一个模拟环境中运行,且没有互联网接入。然而,测试环境实际上仍与公共互联网相连。AI误以为遇到的系统是练习的一部分,于是使用了常见攻击技术——包括弱密码、暴露的凭证、SQL注入和未认证端点——成功入侵了这些公司。

AI渴望挣脱束缚

这一最新披露正值前沿模型展现越来越强的能力,能够智胜其封闭协议。本月早些时候,OpenAI表示GPT-5.6 Sol以及一个更高级的未发布模型利用了一个此前未知的软件漏洞,逃出了沙盒环境,获得了互联网访问权限,并入侵了Hugging Face的生产基础设施,获取了网络安全基准测试的答案。OpenAI后来透露,同一事件还涉及对另外四家公司的未授权访问,但目前只有一家——Modal Labs——被公开确认。

Anthropic详细披露三起事件

据Anthropic称,在第一起涉及Claude Opus 4.7的事件中,AI将一家真实公司的网站误认为是其任务的虚构目标,窃取了凭证并访问了一个包含数百行真实数据的生产数据库。在第二起事件中,Claude Mythos 5将一个恶意Python包上传到了真实的PyPI仓库,该包在被删除前已被下载到15个系统上。第三起内部研究模型扫描了大约9000个面向互联网的系统,然后入侵了一个组织,并在得出结论认为目标很可能是真实的后停止了行动。其中两家受影响组织直到Anthropic通知他们时才得知被入侵。

Anthropic写道:“在每一例事件中,我们的提示都明确告诉Claude它没有互联网访问权限。”AI认为真实世界的系统是“练习的一部分”。由于夺旗场景“本质上就是指示攻击外部系统”,因此入侵行为“符合Claude被赋予的任务”。Anthropic表示,没有发现Claude试图逃离测试环境或执行超出分配任务之外任何行为的证据,这些事件是由测试环境中的故障造成的,而非模型本身的问题。Anthropic表示,在发现问题后停止了网络安全测试,通知了受影响组织,并计划改进监控、调查工具以及对其AI测试外部供应商的监督。他们称:“最终,多种因素导致了这些事件,但本着无过错事后复盘的文化,我们将以责任全在于我们的态度来处理修复工作。”