数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

github (非线智能)官网正文:

智谱最近发布了GLM-5.3-Flash,官方将其定位为GLM-5系列首个原生多模态模型,重点面向更低推理成本下的代码、Agent和视觉任务。官方博客中使用的名称为GLM-5.3-Flash,本次ReLE评测中的API调用名称为glm-5.3-flash,下文涉及ReLE数据时统一使用glm-5.3-flash。

本次ReLE评测侧重中文场景下的综合能力考察,覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及Coding八个板块(约1.5万道题目)。

glm-5.3-flash版本表现:

  • 测试题数:约1.5万
  • 总分(准确率):74.2%
  • 平均耗时(每次调用):128s
  • 平均token(每次调用消耗的token):4689
  • 平均花费(每千次调用的人民币花费):12.7

1、新旧对决

对比旧版本模型GLM-4.7-Flash,glm-5.3-flash在ReLE中文综合评测中的进步非常直观:总分显著跃升,排名直接从尾部区间杀入前十五,平均耗时和token消耗也同步大幅下降。数据如下:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】智谱 GLM-5.3-Flash 实测:Coding与多模态大幅跃升,重塑轻量模型性价比标杆引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】智谱 GLM-5.3-Flash 实测:Coding与多模态大幅跃升,重塑轻量模型性价比标杆

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

*输出价格单位: 元/百万token


  • 总分大幅跃升:glm-5.3-flash总分从49.8%飙升至74.2%(+24.4个百分点),榜单排名从第119位跃升至第15位。智谱的Flash产品线在中文综合能力维度上彻底摆脱了尾部定位。
  • Coding提升最为突出:Coding得分从22.9%暴涨至64.7%(+41.8个百分点),是所有测试分项中涨幅最大的维度。这与官方宣称的重构代码能力方向高度吻合。
  • 推理和语言指令同步上行:推理与数学计算从55.3%提升至84.8%(+29.5个百分点),语言与指令遵从从48.9%提升至77.0%(+28.1个百分点)。核心逻辑能力的改善,直接提升了模型在中文长问答、严格格式约束及复杂推导任务上的表现。
  • 教育、医疗和法律等专业领域全面补齐:教育(64.2%,+27.1个百分点)、医疗与心理健康(87.8%,+25.4个百分点)、法律与行政公务(84.0%,+25.3个百分点)均取得显著进展,基础知识覆盖与泛化能力提升明显。
  • 金融领域稳步提升:金融从63.0%提升至80.9%(+17.9个百分点),保持了稳定的正向增长。
  • Agent工具调用小幅回调:Agent与工具调用从62.7%微降至61.6%(-1.1个百分点)。这是新旧对比中唯一小幅回调的分项,说明在复杂参数传递与多工具协同链路上仍有优化空间。
  • 响应速度大幅提升:题库包含深度推理推导,glm-5.3-flash的单题平均耗时从1238s大幅降至128s(耗时缩减约90%)。在实际批量调用与交互体验上改善明显。

2、横向对比

在当前主流大模型竞争格局中,glm-5.3-flash的表现如何?我们从同成本档位、新旧迭代以及开源商用三个视角展开对比:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】智谱 GLM-5.3-Flash 实测:Coding与多模态大幅跃升,重塑轻量模型性价比标杆
*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

同成本档位对比

  • 10至15元主流轻量档位登顶:在同处10~15元/千次区间内,glm-5.3-flash(74.2%,12.7元)综合得分高于qwen3.8-flash(74.0%,10元)、qwen3.5-flash(68.9%,10.4元)和step-3.5-flash(64.0%,9.8元),在同等成本段中中文综合准确率最高。
  • 相比更低花费模型具备明显性能优势:对比deepseek-v4-flash(68.8%,4.9元)、Doubao-Seed-2.0-mini(69.3%,7元)、hy3(64.0%,1.8元)等几元档模型,glm-5.3-flash虽然花费稍高,但总分高出4.9~10.2个百分点,综合能力跨上了一个台阶。
  • 越级逼近高成本模型:它的综合总分已经超越了部分20~50元区间的模型,如qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)、Doubao-Seed-2.0-pro(72.8%,22.5元)以及kimi-k2.7-code(72.6%,49.7元)。
  • 距离百元级头部模型差距缩小:距离榜首梯队的qwen3.7-max(76.9%)、claude-opus-5(76.8%)、kimi-k3(75.6%)仅相差1.4~2.7个百分点,但调用花费仅为这些百元级旗舰的零头。

新旧模型对比

  • Flash产品线完成关键跨越:上一代GLM-4.7-Flash(49.8%,第119位)位于榜单尾部,而glm-5.3-flash(74.2%,第15位)成功进入前十五,彻底重塑了智谱Flash系列在中文评测中的身位。
  • 极高成本效率比“平替”自家旗舰:在智谱产品线内部,glm-5.3-flash(74.2%,12.7元)距离旗舰glm-5.3(75.2%,134.9元)仅差1.0个百分点,但调用花费不到旗舰的十分之一,具备极高的降本替代价值;同时已超越上一代主力模型glm-5.2(73.0%,110.5元)。
  • 领跑近期发布的主流轻量新模型:glm-5.3-flash不仅领先qwen3.8-flash(74.0%),也优于gemini-3.5-flash(73.9%,151.2元),展现出了非常扎实的迭代效果。

开源/商用对比

  • 稳居开源阵营头部第一梯队:在ReLE榜单收录的开源模型中,glm-5.3-flash位列前排,仅次于kimi-k3(75.6%)、glm-5.3(75.2%)和deepseek-v4-pro(74.9%),得分高于glm-5.2、qwen3.5-plus等开源模型。
  • 与主流商用Flash模型各有侧重:glm-5.3-flash在得分上略高于qwen3.8-flash,与gemini-3.7-flash(75.4%,27.8元)互有长短。在生成速度上,gemini-3.7-flash(10s)响应极快,而glm-5.3-flash(128s)更偏向深度推导。

3、官方评测

根据Z.ai官方博客(https://z.ai/blog/glm-5.3-flash),以下整理官方公布的基准测试结果。官方基准涵盖多模态与工程Agent能力:

代码与Agent基准

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】智谱 GLM-5.3-Flash 实测:Coding与多模态大幅跃升,重塑轻量模型性价比标杆

官方将GLM-5.3-Flash与GLM-5.2、DeepSeek-V4-Vision-Exp、Opus 4.8、GPT-5.6 Terra和Gemini 3.7 Flash进行了对比:

  • 代码工程能力:DeepSWE v1.1得分达63.4(GLM-5.2为46.2);Terminal Bench 2.1为84.3;NL2Repo为56.3。
  • Agent自动化能力:AutomationBench v1.0.6达到48.8(GLM-5.2为26.2);Toolathlon Verified为78.4。
  • Z.ai Code Bench v1.0:在Max Effort模式下,GLM-5.3-Flash得分达29.0,紧逼Claude Opus 4.8(29.5)。

视觉与多模态基准

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】智谱 GLM-5.3-Flash 实测:Coding与多模态大幅跃升,重塑轻量模型性价比标杆
  • 复杂文档理解:OfficeQA Pro得分为62.4,优于DeepSeek-V4-Vision-Exp(57.9)和Opus 4.8(48.9)。
  • 多模态推理:CharXiv Reasoning w/ Tools得分达89.4(接近Opus 4.8的89.9);MMVU得分为80.5(Gemini 3.7 Flash为82.3)。

Base模型基准

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】智谱 GLM-5.3-Flash 实测:Coding与多模态大幅跃升,重塑轻量模型性价比标杆

GLM-5.3-Flash-Base总参数320B,激活参数18B。在LiveCodeBench-Base上取得37.6,高于GLM-5-Base(34.4)和DeepSeek-V4-Flash-Base(29.9);SimpleQA为33.5。



非线智能官网 https://nonelinear.com/static/models.html 已上线glm-5.3-flash,支持一键接入(附接入代码),添加客服 发送 体验金,可享20-50元首充奖励,欢迎对比体验。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】智谱 GLM-5.3-Flash 实测:Coding与多模态大幅跃升,重塑轻量模型性价比标杆

快速接入代码如下:

from openai import OpenAI

client = OpenAI(     base_url="https://api.nonelinear.com/v1",     api_key="YOUR_API_KEY", )
response = client.chat.completions.create(     model="glm-5.3-flash",     messages=[         {"role": "user", "content": "分析一份中文技术文档,提取核心结论与业务落地建议"}     ], )
print(response.choices[0].message.content)