数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

github (非线智能)官网正文:

在此前deepseek-v4-pro-0424之后,深度求索的DeepSeek V4 Pro正式版已经进入本轮ReLE评测。需要说明的是,本次ReLE/API版本名为deepseek-v4-pro;为区分前后版本,下文将deepseek-v4-pro-0424称为上一版参照。本文围绕ReLE中文综合评测数据观察其表现,重点关注准确率、响应时间、token消耗和调用花费等指标。

本次ReLE评测侧重中文场景下的综合能力考察,覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及coding八个板块。

deepseek-v4-pro版本表现:

  • 测试题数:约1.5万
  • 总分(准确率):74.9%
  • 平均耗时(每次调用):145s
  • 平均token(每次调用消耗的token):3679
  • 平均花费(每千次调用的人民币花费):94.1

1、新旧对决

对比上一版参照模型deepseek-v4-pro-0424,deepseek-v4-pro正式版的核心变化是:中文综合准确率明显上升,推理数学和语言指令改善最突出,但coding出现回调,平均耗时、token和调用花费也同步增加。数据如下:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】深度求索DeepSeek V4 Pro正式版实测:推理显著增强、耗时与成本翻倍的权衡与分析引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】深度求索DeepSeek V4 Pro正式版实测:推理显著增强、耗时与成本翻倍的权衡与分析

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

*输出价格单位: 元/百万token


  • 总分进入前十:deepseek-v4-pro正式版总分为74.9%,相比deepseek-v4-pro-0424的71.7%提升3.2个百分点,排名从第22位上升至第9位。
  • 推理数学提升最大:推理与数学计算从71.4%提升至82.3%,提升10.9个百分点,是所有分项中变化最大的一项。这说明正式版在中文推理、计算和复杂问题处理上有较清楚的改善。
  • 语言指令明显改善:语言与指令遵从从69.7%提升至77.0%,提升7.3个百分点。对于中文任务格式、约束遵循和指令理解,这一变化对实际使用体验有直接影响。
  • 多个专业领域同步上升:金融从81.6%提升至84.6%(+3.0个百分点),医疗与心理健康从85.1%提升至88.0%(+2.9个百分点),教育从60.6%提升至63.0%(+2.4个百分点),法律与行政公务从82.0%提升至84.3%(+2.3个百分点)。这些领域的提升幅度不算极端,但方向一致。
  • Agent工具调用小幅提升:agent与工具调用从63.8%提升至65.6%,提升1.8个百分点。相比推理数学和语言指令,这一项提升较小,但没有出现回调。
  • Coding出现下降:coding从72.2%降至66.2%,下降6.0个百分点,是正式版相对上一版最需要留意的变化。
  • 响应时间显著变长:平均耗时从65s增加至145s,增加80s,约为上一版的2.2倍。正式版虽然准确率更高,但端到端响应速度明显变慢。
  • Token和花费同步增加:平均token从2369增至3679,增加约55%;输出价格从24.0元/百万token升至27.0元/百万token,每千次调用花费从54.3元升至94.1元,增加39.8元。

2、横向对比

在当前主流大模型竞争格局中,deepseek-v4-pro正式版作为深度求索的新一版开源旗舰,表现如何?我们从三个维度进行横向对比分析:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】深度求索DeepSeek V4 Pro正式版实测:推理显著增强、耗时与成本翻倍的权衡与分析
*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

同成本档位对比

  • 90至120元区间的高位模型:deepseek-v4-pro(74.9%,94.1元)所处区间内,可比模型包括qwen3.7-max(76.9%,99元)、qwen3.8-max(75.4%,107.3元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、claude-opus-4.8(71.5%,99.4元)、claude-sonnet-5-thinking(70.8%,93.7元)、claude-opus-4.6(70.0%,96.5元)、grok-4.6(69.7%,118.4元)和gpt-5.2-high(67.3%,94.1元)。在这一档位里,deepseek-v4-pro的中文综合总分仅低于qwen3.7-max和qwen3.8-max。
  • 速度不是优势:deepseek-v4-pro平均耗时145s,慢于qwen3.7-max(51s)、qwen3.8-max(67s)、glm-5.2(93s)、claude-opus-4.8(9s)、claude-sonnet-5-thinking(20s)和gpt-5.2-high(36s),也略慢于grok-4.6(144s)。
  • 向上看头部模型:qwen3.7-max(76.9%,99元)、claude-opus-5(76.8%,168.8元)、kimi-k3(75.6%,172.4元)、doubao-seed-evolving(75.5%,304.7元)、qwen3.8-max(75.4%,107.3元)、gpt-5.5(75.3%,158.5元)和gemini-3.1-pro-preview(75.2%,250.5元)仍高于deepseek-v4-pro。差距集中在0.3至2.0个百分点之间。
  • 向下看低成本替代方案:qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)、Doubao-Seed-2.0-pro(72.8%,22.5元)、kimi-k2.7-code(72.6%,49.7元)、deepseek-v4-pro-0424(71.7%,54.3元)等模型花费更低,但总分也低1至3个百分点不等。对于大规模中文文本调用,低成本模型仍有更强的单位花费得分优势;对于更看重总分上限的场景,deepseek-v4-pro正式版提供了更高的准确率位置。

新旧模型对比

  • 正式版补上了总分短板:deepseek-v4-pro-0424(71.7%,第22位)在上一轮已经进入中上游,但距离头部仍有较清楚差距;正式版deepseek-v4-pro(74.9%,第9位)将差距缩小到2个百分点以内,位置更接近第一梯队。
  • 能力结构发生变化:从分项看,正式版主要提升推理数学、语言指令、金融、医疗、教育和法律;agent工具调用小幅提升;coding则从72.2%降至66.2%。
  • 深度求索产品线位置更清晰:当前榜单中,deepseek-v4-pro(74.9%,第9位)位于deepseek-v4-pro-0424(71.7%,第22位)、deepseek-v4-flash(68.8%,第42位)、DeepSeek-V3.2-Think(66.9%,第53位)之上。正式版承担的是DeepSeek体系里更高准确率、更高花费的旗舰位置,而Flash和旧Think版本仍适合更低成本或更轻量的调用场景。
  • 与近期新模型对比:deepseek-v4-pro正式版高于doubao-seed-2-1-pro-260628(74.8%)、claude-opus-4.8-thinking(74.7%)、gpt-5.6-sol-pro(74.4%)和gemini-3.5-flash(73.9%),低于qwen3.8-max(75.4%)、doubao-seed-evolving(75.5%)、kimi-k3(75.6%)、claude-opus-5(76.8%)和qwen3.7-max(76.9%)。头部模型之间的分差已经比较密集,单次排名不宜被放大解读。

开源VS闭源对比

  • 开源阵营中的前排位置:在当前榜单中,开源模型里只有kimi-k3(75.6%,172.4元)高于deepseek-v4-pro(74.9%,94.1元)。它高于qwen3.5-plus(73.3%,22.9元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、kimi-k2.7-code(72.6%,49.7元)、deepseek-v4-pro-0424(71.7%,54.3元)等开源模型。
  • 与闭源头部仍有小幅差距:qwen3.7-max(76.9%)、claude-opus-5(76.8%)、doubao-seed-evolving(75.5%)、qwen3.8-max(75.4%)、gpt-5.5(75.3%)和gemini-3.1-pro-preview(75.2%)仍在deepseek-v4-pro之前。不过,deepseek-v4-pro已经高于多款闭源模型,包括doubao-seed-2-1-pro-260628(74.8%)、claude-opus-4.8-thinking(74.7%)、gpt-5.6-sol-pro(74.4%)、gemini-3.5-flash(73.9%)和gpt-5.4-high(72.6%)。
  • 选型需要看任务权重:如果核心任务是中文综合问答、专业知识和推理,deepseek-v4-pro正式版相比0424版本有明确提升;如果任务更重视低延迟、低花费或coding分项,qwen3.7-plus、qwen3.5-plus、kimi-k2.7-code以及deepseek-v4-pro-0424仍然值得作为参照。
非线智能官网 https://nonelinear.com/static/models.html 已上线正式版deepseek-v4-pro,支持一键接入(附接入代码),添加客服 发送 体验金,可享20-50元首充奖励,欢迎对比体验。
引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】深度求索DeepSeek V4 Pro正式版实测:推理显著增强、耗时与成本翻倍的权衡与分析快速接入代码如下:
from openai import OpenAI

client = OpenAI(     base_url="https://api.nonlinear.com/v1",     api_key="YOUR_API_KEY", )
response = client.chat.completions.create(     model="deepseek-v4-pro",     messages=[         {"role": "user", "content": "分析一份中文行业报告,提取关键结论和风险点"}     ], )
print(response.choices[0].message.content)