回到时间线

7月17日周五02:48Research模型发布AI 安全与对齐模型发布指南

OpenAI 发布 GPT-Red 自动红队模型,击败人类红队 84% 对 13%

Decision Brief

变化OpenAI 训练了内部自动红队模型 GPT-Red,在提示注入测试中以 84% 胜率击败人类红队的 13%。
为什么重要GPT-Red 通过自我对弈强化学习自动发现攻击,将 GPT-5.6 Sol 的提示注入失败率降低 6 倍,对安全工程师而言意味着自动化红队评估能力大幅提升。
谁该关注所有 AI builder
受影响技术栈OpenAI
来源可信度 · 可靠媒体或一手报导

OpenAI 训练了名为 GPT-Red 的内部自动化红队攻击模型,采用自我对弈强化学习,针对一组防御型 LLM 进行对抗训练。在复现的间接提示注入竞技场中,GPT-Red 以 84% 对 13% 的胜率击败人类红队成员,并发现了一种新的攻击类别“虚假思维链”。在 OpenAI 最难的直接提示注入基准上,GPT-Red 使 GPT-5.6 Sol 的失败率降低了 6 倍。不过,OpenAI 承认该模型在多轮和基于图像的攻击方面仍然存在困难。

摘要依据:官方/RSS 来源详摘依据上方标注的来源范围整理,内容以原文为准。

来源

  • MarkTechPost

    Fast research-paper and ML tooling summaries, useful for infra and agent updates.

  • MarkTechPost

相关情报

留言

登入后即可留言,和其他 builder 交换实测心得。

还没有留言,抢头香。