正文:
本次ReLE评测侧重中文场景下的综合能力考察,覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及coding八个板块。
deepseek-v4-pro版本表现:
- 测试题数:约1.5万
- 总分(准确率):74.9%
- 平均耗时(每次调用):145s
- 平均token(每次调用消耗的token):3679
- 平均花费(每千次调用的人民币花费):94.1
1、新旧对决
对比上一版参照模型deepseek-v4-pro-0424,deepseek-v4-pro正式版的核心变化是:中文综合准确率明显上升,推理数学和语言指令改善最突出,但coding出现回调,平均耗时、token和调用花费也同步增加。数据如下:


*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark
*输出价格单位: 元/百万token
- 总分进入前十:deepseek-v4-pro正式版总分为74.9%,相比deepseek-v4-pro-0424的71.7%提升3.2个百分点,排名从第22位上升至第9位。
- 推理数学提升最大:推理与数学计算从71.4%提升至82.3%,提升10.9个百分点,是所有分项中变化最大的一项。这说明正式版在中文推理、计算和复杂问题处理上有较清楚的改善。
- 语言指令明显改善:语言与指令遵从从69.7%提升至77.0%,提升7.3个百分点。对于中文任务格式、约束遵循和指令理解,这一变化对实际使用体验有直接影响。
- 多个专业领域同步上升:金融从81.6%提升至84.6%(+3.0个百分点),医疗与心理健康从85.1%提升至88.0%(+2.9个百分点),教育从60.6%提升至63.0%(+2.4个百分点),法律与行政公务从82.0%提升至84.3%(+2.3个百分点)。这些领域的提升幅度不算极端,但方向一致。
- Agent工具调用小幅提升:agent与工具调用从63.8%提升至65.6%,提升1.8个百分点。相比推理数学和语言指令,这一项提升较小,但没有出现回调。
- Coding出现下降:coding从72.2%降至66.2%,下降6.0个百分点,是正式版相对上一版最需要留意的变化。
- 响应时间显著变长:平均耗时从65s增加至145s,增加80s,约为上一版的2.2倍。正式版虽然准确率更高,但端到端响应速度明显变慢。
- Token和花费同步增加:平均token从2369增至3679,增加约55%;输出价格从24.0元/百万token升至27.0元/百万token,每千次调用花费从54.3元升至94.1元,增加39.8元。
2、横向对比
在当前主流大模型竞争格局中,deepseek-v4-pro正式版作为深度求索的新一版开源旗舰,表现如何?我们从三个维度进行横向对比分析:

同成本档位对比
- 90至120元区间的高位模型:deepseek-v4-pro(74.9%,94.1元)所处区间内,可比模型包括qwen3.7-max(76.9%,99元)、qwen3.8-max(75.4%,107.3元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、claude-opus-4.8(71.5%,99.4元)、claude-sonnet-5-thinking(70.8%,93.7元)、claude-opus-4.6(70.0%,96.5元)、grok-4.6(69.7%,118.4元)和gpt-5.2-high(67.3%,94.1元)。在这一档位里,deepseek-v4-pro的中文综合总分仅低于qwen3.7-max和qwen3.8-max。
- 速度不是优势:deepseek-v4-pro平均耗时145s,慢于qwen3.7-max(51s)、qwen3.8-max(67s)、glm-5.2(93s)、claude-opus-4.8(9s)、claude-sonnet-5-thinking(20s)和gpt-5.2-high(36s),也略慢于grok-4.6(144s)。
- 向上看头部模型:qwen3.7-max(76.9%,99元)、claude-opus-5(76.8%,168.8元)、kimi-k3(75.6%,172.4元)、doubao-seed-evolving(75.5%,304.7元)、qwen3.8-max(75.4%,107.3元)、gpt-5.5(75.3%,158.5元)和gemini-3.1-pro-preview(75.2%,250.5元)仍高于deepseek-v4-pro。差距集中在0.3至2.0个百分点之间。
- 向下看低成本替代方案:qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)、Doubao-Seed-2.0-pro(72.8%,22.5元)、kimi-k2.7-code(72.6%,49.7元)、deepseek-v4-pro-0424(71.7%,54.3元)等模型花费更低,但总分也低1至3个百分点不等。对于大规模中文文本调用,低成本模型仍有更强的单位花费得分优势;对于更看重总分上限的场景,deepseek-v4-pro正式版提供了更高的准确率位置。
新旧模型对比
- 正式版补上了总分短板:deepseek-v4-pro-0424(71.7%,第22位)在上一轮已经进入中上游,但距离头部仍有较清楚差距;正式版deepseek-v4-pro(74.9%,第9位)将差距缩小到2个百分点以内,位置更接近第一梯队。
- 能力结构发生变化:从分项看,正式版主要提升推理数学、语言指令、金融、医疗、教育和法律;agent工具调用小幅提升;coding则从72.2%降至66.2%。
- 深度求索产品线位置更清晰:当前榜单中,deepseek-v4-pro(74.9%,第9位)位于deepseek-v4-pro-0424(71.7%,第22位)、deepseek-v4-flash(68.8%,第42位)、DeepSeek-V3.2-Think(66.9%,第53位)之上。正式版承担的是DeepSeek体系里更高准确率、更高花费的旗舰位置,而Flash和旧Think版本仍适合更低成本或更轻量的调用场景。
- 与近期新模型对比:deepseek-v4-pro正式版高于doubao-seed-2-1-pro-260628(74.8%)、claude-opus-4.8-thinking(74.7%)、gpt-5.6-sol-pro(74.4%)和gemini-3.5-flash(73.9%),低于qwen3.8-max(75.4%)、doubao-seed-evolving(75.5%)、kimi-k3(75.6%)、claude-opus-5(76.8%)和qwen3.7-max(76.9%)。头部模型之间的分差已经比较密集,单次排名不宜被放大解读。
开源VS闭源对比
- 开源阵营中的前排位置:在当前榜单中,开源模型里只有kimi-k3(75.6%,172.4元)高于deepseek-v4-pro(74.9%,94.1元)。它高于qwen3.5-plus(73.3%,22.9元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、kimi-k2.7-code(72.6%,49.7元)、deepseek-v4-pro-0424(71.7%,54.3元)等开源模型。
- 与闭源头部仍有小幅差距:qwen3.7-max(76.9%)、claude-opus-5(76.8%)、doubao-seed-evolving(75.5%)、qwen3.8-max(75.4%)、gpt-5.5(75.3%)和gemini-3.1-pro-preview(75.2%)仍在deepseek-v4-pro之前。不过,deepseek-v4-pro已经高于多款闭源模型,包括doubao-seed-2-1-pro-260628(74.8%)、claude-opus-4.8-thinking(74.7%)、gpt-5.6-sol-pro(74.4%)、gemini-3.5-flash(73.9%)和gpt-5.4-high(72.6%)。
- 选型需要看任务权重:如果核心任务是中文综合问答、专业知识和推理,deepseek-v4-pro正式版相比0424版本有明确提升;如果任务更重视低延迟、低花费或coding分项,qwen3.7-plus、qwen3.5-plus、kimi-k2.7-code以及deepseek-v4-pro-0424仍然值得作为参照。
快速接入代码如下:from openai import OpenAI
client = OpenAI(
base_url="https://api.nonlinear.com/v1",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "user", "content": "分析一份中文行业报告,提取关键结论和风险点"}
],
)
print(response.choices[0].message.content)