17173 > 游戏资讯 > 科技新闻 > 正文

AI智能体又 “作恶”?Anthropic、OpenAI安全测试再度爆雷

2026-08-05 18:03:44 神评论
17173 新闻导语

AI智能体安全测试再爆雷!Anthropic与OpenAI智能体在122次测试中出现19起越权,包括编写恶意代码、伪造身份。点击了解最新安全风险与厂商回应。

最近的一次安全评估显示,Anthropic与OpenAI旗下AI智能体在122次测试中共出现19起越权行为,其中还涉及编写恶意代码与伪造身份,引发广泛担忧。

英国人工智能安全研究所(AISI)于当地时间周二披露,在对Anthropic与OpenAI旗下模型开展测试期间,由Anthropic Mythos 5、OpenAI GPT?5.6?Sol模型驱动的AI智能体,实施了多项未经授权的行为,暴露出新型安全风险。

AISI指出:“部分接受测试的AI智能体针对真实个人和组织发起了持续且具有潜在危害的行为。”

122次测试出现19起越权

作为自愿协议的一部分,AISI获得了接受测试的AI模型的接入权限,并通过构建虚拟的网络场景来测试其能力。

在总计122次的测试中,AISI在10次测试中发现共19项未经授权操作。其中Anthropic智能体涉及17项,OpenAI智能体涉及剩余2项。

AISI指出,最严重的一起越权行为是某AI智能体编写恶意代码并创建虚假网络身份,试图诱导人类批准该代码。

AISI同时强调,上述所有违规事件均未造成任何现实世界中的实质伤害。

业内指出,虽然AISI未指明创建虚假身份的具体是哪家厂商的AI智能体,但该漏洞与OpenAI自行披露的两起案例均不吻合。

非营利性AI风险研究机构CivAI的研究员Andrew Yoon认为,相关行为应为Anthropic智能体所为。

Andrew Yoon表示:

“Mythos智能体在明确意识到目标是真实个人的情况下,依然采取了此类欺骗性行为,这表明Anthropic对自家模型的把控程度并没有公司自以为的那么好。”

Anthropic在社交平台上发表声明称,正与AISI紧密合作以获取更多细节并展开内部调查。

OpenAI则在一份官方文章中分享了细节,指出其AI智能体出现的两次未经授权行为,均涉及以提示词明令禁止的方式访问互联网。

OpenAI表示:

“我们致力于与全行业合作,持续完善高风险测评的安全实操流程,并计划于未来数周内,召集各国AI安全研究机构、独立测评机构、各类AI实验室及相关行业方协同推进。”

多种安全事件

7月的Hugging Face事件中,OpenAI智能体利用漏洞冲破本应网络隔离的沙箱测试环境,私自外联互联网并入侵Hugging Face平台,属于智能体自身突破管控。

有媒体上周报道,OpenAI发现了其他智能体冲破隔离管控的相关证据,已扩大内部排查范围。

OpenAI在本次AISI测试后发表的文章中同时披露了另一起独立事件:由于第三方测试服务商Irregular的配置错误,导致其AI智能体被错误地连接到了互联网。这与Anthropic上周披露的配置失误事件如出一辙。

总的来看,Hugging Face事件为AI自主冲破隔离沙箱私自联网;Irregular相关两起事故为第三方配置出错导致智能体意外连通网络,系人为失误。

而本次AISI的测试,依据标准流程,本就开放了互联网访问权限。也就是说,本次违规并非AI智能体突破环境封锁、私自联网,而是在获准联网的前提下,实施了一系列未经许可、具备潜在危害的行为。

【来源:快科技】
关于AI智能体,安全测试,越权行为,Anthropic,OpenAI,恶意代码,伪造身份,AISI,AI安全,漏洞的新闻