OpenAI 发现约 30% 的流行 AI 编程测试任务存在问题
Decision Brief
What changedOpenAI 审查 SWE-Bench Pro 后发现约 30% 的任务有缺陷,撤回此前对该基准的认可。
Why it matters这一发现直接动摇了 SWE-Bench Pro 作为 AI 编程能力评估基准的可靠性,使用该基准的团队或研究人员需重新审视其评测结果。
Who should careAll AI builders
Affected stackOpenAI
Source confidenceMedium · Reliable media or first-hand reporting
OpenAI 对广泛用于衡量 AI 模型编程能力的 SWE-Bench Pro 基准测试进行了审查,发现其中约 30% 的任务存在缺陷。因此,OpenAI 决定撤回此前对该基准的公开认可。 这一发现意味着依赖 SWE-Bench Pro 评估模型编程能力的开发者或研究团队,其评测结果可能不够准确。尤其是那些参考 OpenAI 此前认可而选择该基准的组织,需重新评估其模型对比的可信度。
Summary basis: official / RSS sourceCompiled from the source scope noted above; the original remains authoritative.
Sources
- The Decoder:AI News
- The Decoder:AI News
留言
登入后即可留言,和其他 builder 交换实测心得。
还没有留言,抢头香。