正文:
需要说明的是,本次ReLE评测侧重中文场景下的综合能力考察,覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及coding八个板块。
glm-5.3版本表现:
- 测试题数:约1.5万
- 总分(准确率):75.2%
- 平均耗时(每次调用):154s
- 平均token(每次调用消耗的token):4981
- 平均花费(每千次调用的人民币花费):134.9
1、新旧对决
对比上一代参照模型glm-5.2,glm-5.3的变化并不是简单的全维度上升:总分和排名继续上移,语言指令、推理数学、医疗和金融改善明显;但agent工具调用、coding、法律和教育出现回调,同时平均耗时、token消耗和调用花费继续增加。数据如下:


*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark
*输出价格单位: 元/百万token
- 总分进入前十:glm-5.3总分为75.2%,相比glm-5.2的73.0%提升2.2个百分点,排名从第19位升至第9位。
- 语言指令提升最大:语言与指令遵从从64.8%提升至75.0%,提升10.2个百分点,是所有分项中变化最大的一项。这说明新版本在中文指令理解、格式约束和任务遵循上有较清楚改善。
- 推理数学和专业领域上升:推理与数学计算从78.0%提升至84.5%(+6.5个百分点),医疗与心理健康从83.7%提升至89.5%(+5.8个百分点),金融从79.0%提升至84.0%(+5.0个百分点)。这些分项共同拉动了总分上移。
- 部分维度出现回调:agent与工具调用从71.6%降至65.7%(-5.9个百分点),法律与行政公务从86.7%降至84.3%(-2.4个百分点),coding从68.7%降至67.3%(-1.4个百分点),教育从63.3%降至62.6%(-0.7个百分点)。这与官方长程coding/agentic基准形成口径差异,后文会继续展开。
- 响应时间明显变长:平均耗时从93s增加至154s,增加61s,约为上一代的1.66倍。GLM-5.3在中文综合准确率上提升,但端到端响应速度变慢。
- Token与花费同步增加:平均token从4109增至4981,增加约21%;输出价格维持28.0元/百万token不变,每千次调用花费从110.5元升至134.9元,增加24.4元,约22%。
2、横向对比
在当前主流大模型竞争格局中,glm-5.3作为智谱AI官方定位为拟开放权重的新一代旗舰,表现如何?我们从三个维度进行横向对比分析:

同成本档位对比
- 约110至160元区间的中高位模型:glm-5.3(75.2%,134.9元)所在成本区间内,重点可比对象包括qwen3.6-max-preview(75.4%,139.2元)、gpt-5.5(75.3%,158.5元)、gemini-3.5-flash(73.9%,151.2元)、doubao-seed-2-1-turbo-260628(73.0%,136.3元)、gpt-5.4-high(72.6%,122.3元)、grok-4.5(70.0%,125.7元)和grok-4.6(69.7%,118.4元)。在这一组里,glm-5.3的中文综合总分仅略低于qwen3.6-max-preview和gpt-5.5。
- 速度不是优势:glm-5.3平均耗时154s,慢于qwen3.6-max-preview(80s)、gpt-5.5(15s)、gemini-3.5-flash(13s)、gpt-5.4-high(24s)、grok-4.5(92s)和grok-4.6(144s),但快于doubao-seed-2-1-turbo-260628(218s)。
- 向下看低成本替代方案:deepseek-v4-pro(74.9%,94.1元)是更接近GLM-5.3总分的低花费参照;qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)、Doubao-Seed-2.0-pro(72.8%,22.5元)、kimi-k2.7-code(72.6%,49.7元)等模型花费也更低,但总分低约1.7至2.6个百分点。对于花费敏感的大规模中文调用,这些模型仍值得纳入候选;对于更看重拟开放权重、复杂工程任务和后训练生态的场景,GLM-5.3需要结合官方长程任务能力一起评估。
新旧模型对比
- 智谱产品线继续上移:glm-5.3(75.2%,第9位)相比glm-5.2(73.0%,第19位)提升2.2个百分点,排名提升10位;相比GLM-5.1(70.7%,第32位)提升4.5个百分点;相比GLM-5(69.0%,第41位)提升6.2个百分点。智谱AI在ReLE中文综合榜单中的位置继续前移。
- 能力结构发生再平衡:GLM-5.2相对GLM-5.1的核心变化是coding补强;GLM-5.3相对GLM-5.2则更偏语言指令、推理数学、医疗和金融提升。与此同时,ReLE中的agent工具调用和coding出现回调。
- 智谱模型矩阵位置:当前榜单中,glm-5.3位于glm-5.2、GLM-5.1、GLM-5-Turbo、GLM-5和GLM-4.7之前,承担智谱体系内更高准确率、更高花费的旗舰位置;旧版和Turbo系列仍更适合更低花费或更轻量的调用场景。
开源/商用对比
- 按ReLE类别划分的开源前排:在当前榜单中,ReLE归入开源类别的模型里只有kimi-k3(75.6%,172.4元)高于glm-5.3(75.2%,134.9元)。GLM-5.3高于deepseek-v4-pro(74.9%,94.1元)、qwen3.5-plus(73.3%,22.9元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、kimi-k2.7-code(72.6%,49.7元)等开源模型。需要注意的是,官方博客称GLM-5.3权重仍待开放。
- 与商用头部仍有差距:qwen3.7-max(76.9%,99元)、claude-opus-5(76.8%,168.8元)、doubao-seed-evolving(75.5%,304.7元)、gemini-3.7-flash(75.4%,27.8元)、qwen3.6-max-preview(75.4%,139.2元)、qwen3.8-max(75.4%,107.3元)和gpt-5.5(75.3%,158.5元)仍在glm-5.3之前。不过,GLM-5.3也高于多款商用类别模型,包括doubao-seed-2-1-pro-260628(74.8%,313.2元)、claude-opus-4.8-thinking(74.7%,238.2元)和gpt-5.6-sol-pro(74.4%,398.7元),并与gemini-3.1-pro-preview(75.2%,250.5元)同分但表中排位更靠前。
3、官方评测
根据智谱AI官方博客(https://z.ai/blog/glm-5.3),官方强调,GLM-5.3与GLM-5.2使用同一基座模型,主要通过后训练扩展获得提升;核心方向包括复杂coding、长程任务、网络安全能力,以及基于slime的长程RL训练体系。

Coding与长程工程任务
- Terminal Bench 3.0:GLM-5.3为28.3,高于GLM-5.2的4.6,也高于Kimi K3的17.4和Opus 4.8的21.1;但仍低于Fable 5的33.7和GPT-5.6 Sol的34.6。官方将其作为拟开放权重模型在复杂终端任务上的重要提升。
- DeepSWE v1.1:GLM-5.3为66.9,高于GLM-5.2的46.2,也高于DeepSeek-V4 Pro-0813的62.7和Opus 4.8的58.0;但略低于Kimi K3的67.5,并低于GPT-5.6 Sol的72.7。
- FrontierSWE:GLM-5.3为78.1,高于GLM-5.2的67.5和Opus 4.8的66.5,但低于Fable 5的88.2。SWE-Marathon v1.1上,GLM-5.3为42.5,高于GLM-5.2的19.4,与GPT-5.6 Sol同分。
- PostTrainBench:GLM-5.3为39.8,高于GLM-5.2的31.7和GPT-5.6 Sol的36.2,但低于Fable 5的41.8。
Cyber能力与安全披露

- CyberGym:GLM-5.3为84.5%,高于GLM-5.2的77.2%、DeepSeek-V4 Pro-0813的83.3%、Fable 5的83.8%和GPT-5.6 Sol的83.6%。这是官方表中GLM-5.3较突出的项目。
- ExploitBench:GLM-5.3为54.4%,高于GLM-5.2的24.4%和Opus 4.8的40.0%,但低于Fable 5的78.0%和GPT-5.6 Sol的76.5%。
- ExploitGym:GLM-5.3在2小时/6小时预算下完成105/130个任务,高于GLM-5.2的29/39和Opus 4.8的80/120,但低于Fable 5的181/247和GPT-5.6 Sol的216/293。
官方还披露,自GLM-5.2以来,团队与多家中国安全团队合作,在真实代码库中识别出2436个漏洞,涉及269个项目,其中1097个为高危及严重级别问题;截至博客发布时,53个已公开披露,2383个仍处于披露流程中。
Agentic任务与知识工作

- AutomationBench v1.0.6:GLM-5.3为48.2,高于GLM-5.2的26.2,也高于Kimi K3的46.7和GPT-5.6 Sol的45.8。
- Agents' Last Exam(ALE-CLI):GLM-5.3为28.5,高于GLM-5.2的23.8和Kimi K3的27.6,略低于GPT-5.6 Sol的28.6。
- HLE w/ Tools:GLM-5.3为62.5,高于GLM-5.2的54.7和Kimi K3的59.8,但低于Fable 5的63.9和GPT-5.6 Sol的64.5。
- GDPval-AA v2:GLM-5.3为1769,高于GLM-5.2的1508、Qwen3.8-Max的1739、Fable 5的1743和GPT-5.6 Sol的1730。
我们非线智能官网 https://nonelinear.com/static/models.html 已上线glm-5.3,支持一键接入(附接入代码),添加客服 发送 体验金,可享20-50元首充奖励,欢迎对比体验。

快速接入代码如下:
from openai import OpenAI
client = OpenAI(
base_url="https://api.nonlinear.com/v1",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[
{"role": "user", "content": "分析一个复杂代码仓库的重构风险,并给出分阶段执行计划"}
],
)
print(response.choices[0].message.content)