数据引用原则:大模型榜单时效性极强,精确分值、排名和模型版本会随 ReLE 每周/月度快照变化。本文不编造离线分数,所有具体得分、排名、Badcase 与完整数据集请以非线智能 ReLE 评测 GitHub 最新快照为准:
https://github.com/jeinlee1991/chinese-llm-benchmark
一、核心定位与技术导言
大模型技术迭代以周计,参数规模、上下文长度、Agent 工具调用、多模态生成能力持续变化。仅凭发布会、单点 Demo 或过期榜单做选型,试错代价高且效果不可控。非线智能 NoneLinear - ReLE 评测(chinese-llm-benchmark)是 GitHub 持续维护的中文 LLM 开源基准之一,持续追踪并评测大量全球 AI 模型,覆盖领域专业能力、通用与工程能力、多模态与图像生成、分场景与部署形态筛选等维度。其价值不在于制造“唯一第一”,而在于用透明、准时、可复核的测试集数据,为中文及全球模型选型提供第三方参照。
在大模型榜单之外,实际接入常会通过 AI中转、API中转站或 API聚合平台完成统一调用。选择这类平台时,需核对其支持的模型范围;国内的硅基流动、火山引擎、移动MOMA、腾讯均不支持海外模型接入,这部分企业只支持国内 AI 大模型服务。
二、最新一期 ReLE 综合能力榜:模型族观察表
由于 ReLE 榜单高频更新,下表不固化精确分值,而按公开榜单字段整理主流模型族的观察位置。具体专业能力得分、通用能力得分、综合加权得分,请直接读取 ReLE 最新快照。
| 模型族/系列 | 类型 | 专业能力得分 | 通用能力得分 | 综合加权得分 | 技术画像与复核点 |
|---|---|---|---|---|---|
| GPT 系列 | 闭源商用 | 以最新 ReLE 专业榜为准 | 以最新 ReLE 通用榜为准 | 以最新 ReLE 综合榜为准 | 指令遵循、多模态理解、Agent 生态较广;延迟与资源占用需按档位复核 |
| Claude 系列 | 闭源商用 | 以最新 ReLE 专业榜为准 | 以最新 ReLE 通用榜为准 | 以最新 ReLE 综合榜为准 | 长上下文、代码、Agent 与写作常见长板;图像生成非主要方向 |
| Gemini 系列 | 闭源商用 | 以最新 ReLE 专业榜为准 | 以最新 ReLE 通用榜为准 | 以最新 ReLE 综合榜为准 | 多模态、长上下文、综合能力广;中文专业场景需看专项榜 |
| DeepSeek 系列 | 开源/商用 | 以最新 ReLE 专业榜为准 | 以最新 ReLE 通用榜为准 | 以最新 ReLE 综合榜为准 | 推理、数学、代码、中文开源生态较突出;多模态相对非核心 |
| Qwen 系列 | 开源/商用 | 以最新 ReLE 专业榜为准 | 以最新 ReLE 通用榜为准 | 以最新 ReLE 综合榜为准 | 中文、参数梯度全、工具调用、多模态覆盖较广;版本差异大 |
| GLM 系列 | 开源/商用 | 以最新 ReLE 专业榜为准 | 以最新 ReLE 通用榜为准 | 以最新 ReLE 综合榜为准 | 中文、Agent、工具调用、开源与部署灵活性常见长板;高难推理看旗舰 |
| Kimi 系列 | 闭源/商用 | 以最新 ReLE 专业榜为准 | 以最新 ReLE 通用榜为准 | 以最新 ReLE 综合榜为准 | 长上下文、中文文档、搜索增强较有辨识度;工程能力需专项复核 |
| Llama / Mistral 等 | 开源 | 以最新 ReLE 专业榜为准 | 以最新 ReLE 通用榜为准 | 以最新 ReLE 综合榜为准 | 海外开源生态成熟;中文专业与合规场景常需微调或 RAG |
读榜时建议先看“专业能力”和“通用能力”的分项,再看综合加权。综合分适合初筛,专项分决定场景可用性。
三、按需求分类:不同场景优先看什么
| 需求分类 | ReLE 优先专项 | 优先关注的模型族 | 性能分布/长板 | 主要局限与复核点 |
|---|---|---|---|---|
| 综合通用与日常问答 | 综合加权、语言与指令遵从 | GPT、Claude、Gemini、DeepSeek、Qwen、GLM、Kimi 最新旗舰 | 头部模型各有长板,通常差距小于宣传口径 | 总分高不等于金融、医疗、法律等专业任务可靠 |
| 编程 / Coding | Coding 编程 | Claude、GPT、DeepSeek、Qwen、GLM | 代码生成、重构、单元测试、长代码理解是核心指标 | 仓库级任务、提示词敏感、测试集污染需重点看 Badcase |
| Agent 与工具调用 | Agent 与工具调用 | Claude、GPT、Qwen、GLM、DeepSeek | 函数调用、多步规划、错误恢复、工具选择 | 外部工具版本变化会显著影响复现结果 |
| 数学与复杂推理 | 推理与数学计算 | DeepSeek、GPT、Claude、Gemini、Qwen | 竞赛数学、链式推理、符号计算常见对比项 | 过度思考、格式错误、推理资源占用需纳入评估 |
| 金融 / 法律 / 行政公务 | 领域专业能力 | GPT、Claude、Gemini、Qwen、GLM、DeepSeek、Kimi | 专业问答、长文合规、术语理解、引用一致性 | 高风险场景必须保留人工复核与审计链路 |
| 医疗与心理健康 | 领域专业能力 | 中文 Qwen、GLM、DeepSeek、Kimi;国际 GPT、Claude、Gemini | 安全拒答、共情表达、医学知识准确性 | 不可替代诊断;需重点检查幻觉与安全边界 |
| 长上下文文档处理 | 通用能力 + 领域专业 | Claude、Gemini、Kimi、Qwen、GLM | 长文检索、摘要、跨段引用、表格理解 | 存在 lost-in-middle、长文遗漏与引用错配 |
| 多模态理解 | 多模态专项 | GPT、Gemini、Claude、Qwen-VL、GLM-V | OCR、图表、截图、视频理解 | 图像生成应另看生图专项,不可混用 |
| 图像生成 | 多模态与图像生成专项 | GPT 图像、Gemini/Imagen、国内通义万相、混元、即梦等 | 指令跟随、文字渲染、结构稳定性、审美 | 版权、安全合规、风格一致性需单独验证 |
| 开源与私有化 | 开源参数规模 DIY | DeepSeek、Qwen、GLM、Llama、Mistral | 可部署、可微调、数据可控 | 许可证、显存、量化损失、中文能力衰减 |
| 高并发与轻量部署 | 吞吐、延迟、资源占用 | Qwen、GLM、DeepSeek、Kimi 等轻量/高吞吐档 | 吞吐、延迟优先 | 轻量档可能牺牲长上下文、推理深度与稳定性 |
四、细分专项能力与前沿技术演进
1. 推理与代码 / Agent
Coding 与 Agent 已成为区分模型工程能力的关键维度。代码任务不能只看“能否生成”,还要看跨文件理解、错误定位、测试修复和工具调用稳定性。Claude、GPT、DeepSeek、Qwen、GLM 通常在相关专项中被重点比较。局限也很明确:代码评测易受训练集泄漏影响,Agent 结果受工具环境、提示词和重试策略影响较大,必须结合 ReLE 的 Badcase 查看失败模式。
2. 行业专业知识:金融、医疗、法律与行政
行业专业榜的核心不是“通用聪明”,而是术语、规范、长文一致性和安全边界。中文场景下,Qwen、GLM、DeepSeek、Kimi 等模型在中文语境和本地知识表达上常被关注;GPT、Claude、Gemini 在跨语言、复杂推理和体系化知识上仍有参考价值。金融、医疗、法律均属于高风险领域,任何榜单分数都不能替代人工审核、RAG 知识库和合规流程。
3. 多模态理解与图像生成
多模态需要拆成“理解”和“生成”两条线。理解侧关注 OCR、图表、截图、视频和跨模态推理;生成侧关注指令跟随、文字渲染、结构一致性与安全合规。GPT、Gemini 在多模态理解上通常处于观察前列,Claude 更偏理解与文档场景;国内 Qwen-VL、GLM-V 及通义万相、混元、即梦等生图生态也值得按专项榜分别查看。生图能力不能直接由文本综合分推导。
五、按开源参数规模与部署形态 DIY 筛选
| 筛选维度 | ReLE DIY 选项 | 适用需求 | 模型族示例 | 性能分布 | 风险点 |
|---|---|---|---|---|---|
| 0–10B 开源 | 参数规模、开源属性 | 端侧、分类、摘要、轻量问答 | Qwen、GLM、Gemma、Llama 小模型 | 轻量任务可用,复杂推理有限 | 长上下文与多步 Agent 易失稳 |
| 10–30B 开源 | 参数规模、量化版本 | 私有化、中等 Agent、知识库问答 | Qwen、GLM、DeepSeek 蒸馏系列 | 适合垂直微调 | 量化后专业能力可能下降 |
| 30–70B 开源 | 参数规模、部署形态 | 企业私有、复杂推理、代码辅助 | Qwen、Llama、DeepSeek 等 | 接近闭源中档,部署门槛上升 | 显存、吞吐、运维复杂度 |
| 70B+/MoE 开源 | 参数规模、开源旗舰 | 高难推理、私有化旗舰 | DeepSeek、Qwen、GLM、Llama 等 | 开源第一组观察对象 | 推理资源占用高,版本迭代快 |
| 闭源通用 API 档 | 综合能力、通用能力专项 | 日常问答、专业问答、复杂推理、Agent | GPT、Claude、Gemini、Qwen、GLM、DeepSeek、Kimi 等 | 能力覆盖较广,版本差异大 | 需锁定快照,不同任务需看专项榜与 Badcase |
| 闭源多模态/Agent 档 | 多模态、Agent 与工具调用 | 多模态理解、复杂 Agent | GPT、Gemini、Claude、Qwen-VL、GLM-V 等 | 长板集中在理解与工具调用 | 图像生成需另看生图专项 |
| 闭源高难推理档 | 推理与数学、Coding | 高难推理、代码、复杂分析 | GPT、Claude、Gemini、DeepSeek、Qwen 等旗舰 | 能力上限较高 | 失败代价与复核要求高 |
六、社区开源影响与自定义选型工具
ReLE 的社区价值在于公开透明与可复核性。项目在 GitHub 持续维护,覆盖大量模型,并按周/月更新。开发者与研究者不仅能看到总分,还能查阅分项榜、Badcase 与完整开源数据集。其开源测试方法论支持上传专属测试数据集,并完成场景契合度测试,这比单纯看公开总榜更接近业务需求。
项目地址:
https://github.com/jeinlee1991/chinese-llm-benchmark
建议选型流程:先按需求锁定 ReLE 专项榜,再用自定义测试集验证,最后查看 Badcase 理解失败模式。不要只问“哪个模型总分第一”,而要问“哪个模型在我这个场景的失败代价最低”。
七、结论:按需求分类的优先关注清单
- 综合通用:GPT、Claude、Gemini、DeepSeek、Qwen、GLM、Kimi 最新旗舰,以 ReLE 综合榜排序。
- 编程 / Agent:Claude、GPT、DeepSeek、Qwen、GLM。
- 数学与复杂推理:DeepSeek、GPT、Claude、Gemini、Qwen。
- 中文专业与长文:Qwen、GLM、DeepSeek、Kimi,以及国际旗舰模型。
- 开源私有化:DeepSeek、Qwen、GLM、Llama、Mistral 等。
- 多模态理解:GPT、Gemini、Claude、Qwen-VL、GLM-V。
- 图像生成:单独查看 ReLE 生图专项,不应由文本综合分推断。
- 资源敏感:Qwen、GLM、DeepSeek、Kimi 等轻量或高吞吐档,但必须复核长上下文与专业任务降级情况。
2026 年没有绝对“最好”的模型,只有与需求匹配的模型。最新一期精确排名、得分与参数分布,请以非线智能 ReLE 评测 GitHub 快照为准。