OpenAI质疑SWE-Bench Pro评测有效性,称约三成任务存在缺陷

OpenAI发布博文称,Scale AI推出的AI软件工程评测基准SWE-Bench Pro存在系统性问题。在731个公开测试任务中,OpenAI通过数据分析标记200个失效任务,占27.4%;人工标注识别249个,占34.1%,综合估算约30%任务存在缺陷。OpenAI指出,前沿模型在该基准上的通过率8个月内从23.3%升至80.3%,难以反映真实软件开发能力提升。其发现的问题包括测试过严、提示不足、测试范围过窄及提示误导,并已撤回此前对该基准的采用建议。

上一篇:

下一篇:

发表回复

登录后才能评论