CLUE 团队发布 SuperCLUE-Terminal 中文智能体终端编程测评榜单,DeepSeek-V4-Pro-0813 以 51.52 分位列第二,仅次于 Kimi K3 的 60.61 分。榜单面向国内开发者,采用本土真实编程任务,并统一使用 Claude Code 框架测试模型的需求理解、任务规划、工具调用和排错改码能力。DeepSeek-V4-Pro-0813 单题调用成本约 1.42 元,约为 Kimi K3 的十四分之一,测试覆盖前端、3D 游戏和工程脚本等场景。
CLUE 团队发布 SuperCLUE-Terminal 中文智能体终端编程测评榜单,DeepSeek-V4-Pro-0813 以 51.52 分位列第二,仅次于 Kimi K3 的 60.61 分。榜单面向国内开发者,采用本土真实编程任务,并统一使用 Claude Code 框架测试模型的需求理解、任务规划、工具调用和排错改码能力。DeepSeek-V4-Pro-0813 单题调用成本约 1.42 元,约为 Kimi K3 的十四分之一,测试覆盖前端、3D 游戏和工程脚本等场景。