回到时间线

7月9日周四21:23Research模型发布AI Coding研究与论文模型发布指南

OpenAI 发现约 30% 的流行 AI 编程测试任务存在问题

Decision Brief

变化OpenAI 审查 SWE-Bench Pro 后发现约 30% 的任务有缺陷,撤回此前对该基准的认可。
为什么重要这一发现直接动摇了 SWE-Bench Pro 作为 AI 编程能力评估基准的可靠性,使用该基准的团队或研究人员需重新审视其评测结果。
谁该关注所有 AI builder
受影响技术栈OpenAI
来源可信度 · 可靠媒体或一手报导

OpenAI 对广泛用于衡量 AI 模型编程能力的 SWE-Bench Pro 基准测试进行了审查,发现其中约 30% 的任务存在缺陷。因此,OpenAI 决定撤回此前对该基准的公开认可。 这一发现意味着依赖 SWE-Bench Pro 评估模型编程能力的开发者或研究团队,其评测结果可能不够准确。尤其是那些参考 OpenAI 此前认可而选择该基准的组织,需重新评估其模型对比的可信度。

摘要依据:官方/RSS 来源详摘依据上方标注的来源范围整理,内容以原文为准。

来源

相关情报

留言

登入后即可留言,和其他 builder 交换实测心得。

还没有留言,抢头香。