OpenAI发布博文称,Scale AI推出的AI软件工程评测基准SWE-Bench Pro存在系统性问题。在731个公开测试任务中,OpenAI通过数据分析标记200个失效任务,占27.4%;人工标注识别249个,占34.1%,综合估算约30%任务存在缺陷。OpenAI指出,前沿模型在该基准上的通过率8个月内从23.3%升至80.3%,难以反映真实软件开发能力提升。其发现的问题包括测试过严、提示不足、测试范围过窄及提示误导,并已撤回此前对该基准的采用建议。
OpenAI发布博文称,Scale AI推出的AI软件工程评测基准SWE-Bench Pro存在系统性问题。在731个公开测试任务中,OpenAI通过数据分析标记200个失效任务,占27.4%;人工标注识别249个,占34.1%,综合估算约30%任务存在缺陷。OpenAI指出,前沿模型在该基准上的通过率8个月内从23.3%升至80.3%,难以反映真实软件开发能力提升。其发现的问题包括测试过严、提示不足、测试范围过窄及提示误导,并已撤回此前对该基准的采用建议。