OpenAI 发布 GPT-Red 自动红队模型,击败人类红队 84% 对 13%
Decision Brief
变化OpenAI 训练了内部自动红队模型 GPT-Red,在提示注入测试中以 84% 胜率击败人类红队的 13%。
为什么重要GPT-Red 通过自我对弈强化学习自动发现攻击,将 GPT-5.6 Sol 的提示注入失败率降低 6 倍,对安全工程师而言意味着自动化红队评估能力大幅提升。
谁该关注所有 AI builder
受影响技术栈OpenAI
来源可信度中 · 可靠媒体或一手报导
OpenAI 训练了名为 GPT-Red 的内部自动化红队攻击模型,采用自我对弈强化学习,针对一组防御型 LLM 进行对抗训练。在复现的间接提示注入竞技场中,GPT-Red 以 84% 对 13% 的胜率击败人类红队成员,并发现了一种新的攻击类别“虚假思维链”。在 OpenAI 最难的直接提示注入基准上,GPT-Red 使 GPT-5.6 Sol 的失败率降低了 6 倍。不过,OpenAI 承认该模型在多轮和基于图像的攻击方面仍然存在困难。
摘要依据:官方/RSS 来源详摘依据上方标注的来源范围整理,内容以原文为准。
来源
- MarkTechPost
Fast research-paper and ML tooling summaries, useful for infra and agent updates.
- MarkTechPost
留言
登入后即可留言,和其他 builder 交换实测心得。
还没有留言,抢头香。