腾讯发布多领域编码智能体评测套件 WorkBuddy Bench

腾讯多家实验室在 arXiv 发布 WorkBuddy Bench,多领域编码智能体评测套件覆盖代码、网页、办公、安全四类任务,共260题。任务由真实提交、PR和业务场景逆向改写,公开任务目录、环境镜像、测试用例和参考方案,以版本管理增强抗污染。评测在隔离容器中进行,禁用联网搜索与用户交互;榜单显示 Claude Opus 4.8 在多数子集领先,GLM-5.2 和 GPT-5.5 分别在安全、办公子集居前。团队称代码子集以 Python 为主,后续将扩充公开榜单。

上一篇:

下一篇:

发表回复

登录后才能评论