打造 AI 网安“红队”:OpenAI 介绍内部漏洞检测模型 GPT-Red
2026-07-16 12:02:30
神评论
17173 新闻导语
OpenAI推出AI网安红队GPT-Red,自动化模拟网络攻击,提升模型鲁棒性,最新模型攻击失败率仅0.05%,开启网络安全良性循环。
感谢网友 Nuc_F 的线索投递!
7 月 16 日消息,OpenAI 当地时间 15 日介绍了其内部使用的网络安全“红队”模型 GPT-Red。该模型可自动化地进行各种网络攻击模拟,帮助 OpenAI 提升对外模型产品的鲁棒性。

OpenAI 表示,其过去半年自 GPT-5.3 后的每个生产模型均将“红队”模型用于训练。伪造思维链型攻击的成功率已从 GPT-5.1 上的 95% 降低至最新模型上的不足 10%;最新的 GPT-5.6 Sol 在 GPT-Red 的直接提示符注入攻击中失败率仅有 0.05%。
GPT-Red 使用自博弈强化学习进行训练:其本身和一组不同的防御型 LLM 在广泛的红队场景上同时进行训练。GPT-Red 因成功诱发有效失败而获得奖励,而防御型模型则因抵抗攻击并完成其原始任务而获得奖励。随着防御型模型变得越来越强大,GPT-Red 被迫发现更强大、更多样化的攻击。
“红队”模型与产品模型相隔离。OpenAI 相信其已开启了良性的人工智能网络安全循环,可利用现有模型来增强未来模型的鲁棒性、一致性、可信度。
【来源:IT之家】
今日热点
热门测试游戏
- 17.7万在线峰值,但只有45%好评率:这网游咋刚火就翻车了?
- 2腾讯《穿越火线:潜伏》开发生变?开发中途裁员,进度引忧
- 3前作《执剑之刻》曾获3亿流水 老牌女性向团队深陷经营困局
- 4DeepSeek入局游戏,高薪招聘游戏AI程序员,月薪近百万!
- 5降低预期?杨奇暗示820或无《黑神话:钟馗》重磅实机内容
- 6赚真美金!玩撤离游戏《BR1: Infinite》每小时可赚10美元
- 7腾讯《王者万象棋》公测定档 全网预约突破5000万
- 8难产18年!曝育碧压箱底王牌游戏将更名重启 今年TGA亮相
- 9iOS预约开启!《梦幻新诛仙:轻享》官宣9月全平台公测
- 10《鸣潮》3.6版本「蜃云灯影,凡尘剑心」上线时间确定

