北京大学DCAI团队近日发布开源评测框架One-Eval,并在DeepSeek-V4发布后10小时内完成全量自动化评测报告,引发业界关注。One-Eval旨在解决长期困扰大模型开发者的评测效率与透明度问题,通过自然语言驱动的智能体模式,用户可直接以对话方式触发评测任务,系统自动匹配专业基准并完成配置,显著降低测试成本。框架引入全局状态总线实现全链路可追溯,并保留“人工在环”机制以确保结果可靠。在评测商业化竞争加剧的背景下,北大One-Eval开源被认为为AI测评领域带来新的开放范式,加快大模型评测向标准化与自动化转型。