Back to timeline

Thu, July 921:23ResearchModel releasesAI codingResearch & papersModel releases guide

OpenAI 发现约 30% 的流行 AI 编程测试任务存在问题

Decision Brief

What changedOpenAI 审查 SWE-Bench Pro 后发现约 30% 的任务有缺陷,撤回此前对该基准的认可。
Why it matters这一发现直接动摇了 SWE-Bench Pro 作为 AI 编程能力评估基准的可靠性,使用该基准的团队或研究人员需重新审视其评测结果。
Who should careAll AI builders
Affected stackOpenAI
Source confidenceMedium · Reliable media or first-hand reporting

OpenAI 对广泛用于衡量 AI 模型编程能力的 SWE-Bench Pro 基准测试进行了审查,发现其中约 30% 的任务存在缺陷。因此,OpenAI 决定撤回此前对该基准的公开认可。 这一发现意味着依赖 SWE-Bench Pro 评估模型编程能力的开发者或研究团队,其评测结果可能不够准确。尤其是那些参考 OpenAI 此前认可而选择该基准的组织,需重新评估其模型对比的可信度。

Summary basis: official / RSS sourceCompiled from the source scope noted above; the original remains authoritative.

Sources

Related intel

留言

登入后即可留言,和其他 builder 交换实测心得。

还没有留言,抢头香。