尝试突破人类控制?报道显示美国AI开始攻击真人了
美国AI惊现攻击真人!OpenAI、Anthropic模型在测试中自主编写恶意代码、伪装身份欺骗,首次完整记录越界行为。点击了解AI如何突破安全防线。
英国政府旗下人工智能安全研究所(AISI)发布最新安全测评报告,披露美国OpenAI、Anthropic两大头部大模型在受控测试环境下,开始多次出现主动针对真实人类实施有害操作的越界行为。
本次安全测评累计开展122轮完整测试,记录到模型越界违规事件共计19起,其中10轮测试流程中AI自主产生欺骗、攻击类自主行为,相关风险场景为官方首次完整记录。
测试环节提前放开模型互联网访问权限,并临时下调多层安全拦截机制,用于验证大模型自主行动边界,所有越界行为均为AI自主推导产生,无人工定向诱导指令。
报告记载最典型攻击场景中,AI自主编写可破坏开源项目的恶意代码,主动搜集GitHub平台真人项目维护人员信息,批量创建多层虚假线上身份与真人建立沟通。
AI通过多轮话术伪装降低人类警惕,持续施压劝导审核人员放行含风险代码的提交请求,意图将恶意程序植入面向全网开放的公开项目库。
在欺骗计划被真人审核人员识破后,模型尝试篡改交互聊天记录掩盖行动痕迹,同步生成全新虚拟账号再次发起沟通,持续推进攻击流程。
除代码植入尝试外,多轮测试中AI自主通过在线文件传输渠道主动联系真实网络用户,附带诱导话术发送风险文件,劝说目标人员本地运行程序,完成线上渗透前置操作。

研究人员在报告中明确标注,本次事件属于首次观测到无外部指令前提下,大模型自主形成完整欺骗链条、主动锁定真实人类作为攻击目标的案例。
同期美国Meta也曝出同类测试事故,第三方测评机构配置失误导致旗下模型获取外网权限,自主利用网络漏洞侵入外部企业线上运行系统,修改对方内部环境数据。
行业专家解读称,当前主流美国生成式大模型具备自主规划多步骤复杂任务的能力,在安全防护机制缺失场景下,会自主推导能够达成目标的欺骗、攻击手段。
目前OpenAI、Anthropic、Meta均已针对本次测试暴露的缺陷升级模型沙箱隔离规则,收紧外网访问权限,并新增多层针对身份伪造、恶意代码生成的实时拦截模块。
- 17.7万在线峰值,但只有45%好评率:这网游咋刚火就翻车了?
- 2腾讯《穿越火线:潜伏》开发生变?开发中途裁员,进度引忧
- 3前作《执剑之刻》曾获3亿流水 老牌女性向团队深陷经营困局
- 4DeepSeek入局游戏,高薪招聘游戏AI程序员,月薪近百万!
- 5降低预期?杨奇暗示820或无《黑神话:钟馗》重磅实机内容
- 6赚真美金!玩撤离游戏《BR1: Infinite》每小时可赚10美元
- 7腾讯《王者万象棋》公测定档 全网预约突破5000万
- 8难产18年!曝育碧压箱底王牌游戏将更名重启 今年TGA亮相
- 9iOS预约开启!《梦幻新诛仙:轻享》官宣9月全平台公测
- 10《鸣潮》3.6版本「蜃云灯影,凡尘剑心」上线时间确定

