最新消息:关注人工智能 AI赋能新媒体运营

DeepSeek V4 Pro 编程评测排名第二:性能逼近 Kimi K3,成本仅其 1/14

科技资讯 admin 浏览

SuperCLUE 中文智能体编程测评:DeepSeek-V4-Pro-0813 性价比领跑

CLUE 团队发布的 SuperCLUE-Terminal 中文智能体终端编程测评榜单显示,DeepSeek-V4-Pro-0813 以 51.52 分位列第二,仅次于榜首的 Kimi K3。该榜单面向国内开发者,采用本土真实编程任务,以 Claude Code 为统一运行框架,评估模型理解中文需求、任务规划、工具调用及代码排错等综合能力。

评测任务高度还原实际开发场景:每题需 50 至 110 轮交互,完整运行耗时 30 至 90 分钟。本轮榜单中,Kimi K3 以 60.61 分位居首位,DeepSeek-V4-Pro-0813 排名第二,高于 GLM-5.2(48.48 分)和 DeepSeek-V4-Flash(46.46 分)。

单题成本 1.42 元,成本差距达数量级

DeepSeek-V4-Pro-0813 的核心优势在于成本控制。其单题调用成本约 1.42 元,约为 Kimi K3 的十四分之一、GLM-5.2 的十六分之一。在头部模型分数差距有限的情况下,这一成本差异使中小团队能够以较低投入获得接近第一梯队的编程能力。

实测显示,该模型可完成前端页面开发、3D 游戏及工程脚本修改等任务,游戏开发中的碰撞检测、计分、结算等功能运行正常,页面设计与交互反馈也达到可用水平。部分创意绘图题目存在细节瑕疵,整体完成度仍处前列。

对于预算敏感的中小企业和独立开发者,DeepSeek-V4-Pro-0813 以"第二名的分数、十四分之一的价格"提供了具有竞争力的选择,降低了 AI 编程工具的实际使用门槛。