OpenAI 用 AI 攻击自家 AI,成功率远超人类红队
Decision Brief
变化OpenAI 内部 GPT-Red 模型通过自我对抗训练在 84% 测试场景中找到漏洞,而人类红队仅 13%。
为什么重要对 AI 安全团队而言,这种自动化红队方法显著提升了漏洞发现效率,可更快速强化模型鲁棒性。
谁该关注所有 AI builder
受影响技术栈OpenAI
来源可信度中 · 可靠媒体或一手报导
OpenAI 开发了内部模型 GPT-Red,通过自我对抗训练自动寻找自家 AI 系统的安全漏洞。在测试中,GPT-Red 在 84% 的场景中成功实现攻击,相比之下,人类红队成员的成功率仅为 13%。这些发现结果直接用于加固后续模型,例如 GPT-5.6 Sol。 对于 OpenAI 的安全研究人员和模型开发者来说,这种 AI 驱动的红队方法大幅提高了漏洞发现的覆盖率和效率,减少了人工成本,并能更及时地将修复措施集成到模型训练中。这也为整个行业提供了一个可扩展的自动化安全测试范式。
摘要依据:官方/RSS 来源详摘依据上方标注的来源范围整理,内容以原文为准。
来源
- The Decoder:AI News
- The Decoder:AI News
留言
登入后即可留言,和其他 builder 交换实测心得。
还没有留言,抢头香。