
如果你正在做 Coding Agent、AI SaaS、RAG 或企业知识库,团队中往往有接入多个最新大模型,如 DeepSeek、Kimi 和 GLM 等的需求;或者你正在进行多模型的企业采购,这篇文章能帮到你:
个人使用和企业采购- 看清同一模型在原厂、云平台和聚合 API 上的公开价格差异
- 分清缓存、分时价格、活动价分别适合什么场景
- 判断团队更适合分别接入,还是使用统一 API
比较的平台包括:智谱官方、DeepSeek 官方、Kimi 官方、阿里云百炼、腾讯云 TokenHub、百度千帆、火山方舟、硅基流动、非线智能
先别急着找一个“全场最低价”的平台。公开数据里,目前并不存在这么简单的答案。
一、比价格之前,先确认是不是同一个模型
先把模型对齐。
同样写着 DeepSeek V4,一个平台提供固定 Snapshot,另一个平台只写了不带日期的自有部署服务。两者即使价格相差一半,也不能直接说“同一个模型便宜了50%”。
本文只围绕下面这些当前生产型号展开:
| 厂商 | 本文重点模型 | 上下文 |
|---|---|---|
| 智谱 | GLM-5.3 | 1M |
| 智谱 | GLM-5.3-Flash | 1M |
| DeepSeek | deepseek-v4-flash → DeepSeek-V4-Flash-0731 | 1M |
| DeepSeek | deepseek-v4-pro → DeepSeek-V4-Pro-0813 | 1M |
| Moonshot | Kimi K3 | 1M |
DeepSeek 官方已经公开了无日期 API 别名与具体版本的映射:
deepseek-v4-flash对应DeepSeek-V4-Flash-0731;
deepseek-v4-pro对应DeepSeek-V4-Pro-0813。
后文涉及 DeepSeek 的价格倍数时,只比较能够确认 Snapshot 的服务。第三方没有公开映射的,只列价格,不强行计算比原厂便宜或贵多少。
目前哪些国内平台能直接调用这些模型:
| 平台 | GLM-5.3 / 5.3-Flash | DeepSeek V4 | Kimi K3 |
|---|---|---|---|
| 智谱官方 | ✅ | — | — |
| DeepSeek 官方 | — | ✅ | — |
| Kimi 官方 | — | — | ✅ |
| 阿里云百炼 | ✅ | ✅ | ✅ |
| 腾讯云 TokenHub | ✅ | ✅ | ✅ |
| 百度千帆 | ✅ | ✅ | — |
| 火山方舟 | — | ✅ | — |
| 硅基流动 | — | ✅ | — |
| 非线智能 | ✅ | ✅ | ✅ |
这张表也提醒了一件事:聚合平台模型多,不代表每个最新型号都会同步上线。选 API 时,先确认 Model ID、Snapshot 和服务供应方式,再看单价。
二、GLM:5.3 多家同价,原厂正在做活动
智谱当前公开的 GLM-5.3 和 GLM-5.3-Flash 价格如下:

先看GLM-5.3原价。它在目前能够核实的平台上公开价格一致:
| 平台 | 缓存命中 | 输入 | 输出 |
|---|---|---|---|
| 智谱官方 | ¥2 | ¥8 | ¥28 |
| 阿里云百炼 ZHIPU/GLM-5.3 | ¥2 | ¥8 | ¥28 |
| 腾讯 | ¥2 | ¥8 | ¥28 |
| 百度千帆 | ¥2 | ¥8 | ¥28 |
| 非线智能 glm-5.3 | 同原厂 | 同原厂 | 同原厂 |
阿里将ZHIPU/GLM-5.3标为智谱原厂直供,推理服务供应商是智谱 AI。公开单价相同以后,平台之间比的就不只是价格,还包括账号与账单管理、IAM 权限、限流、套餐、工具链以及 API 是否统一。
GLM-5.3-Flash 是另一种情况。智谱截至2026年9月1日的价格页显示,它正在进行“限时两周5折”活动,支持文本、图片、视频和文件输入,上下文为1M。活动期间,100万输入 Token 是4毛钱,100万输出 Token 是1.4元。
| 平台 | 缓存命中 | 输入 | 输出 | 价格性质 |
|---|---|---|---|---|
| 智谱官方 | ¥0.115 | ¥0.4 | ¥1.4 | 当前5折活动 |
| 阿里云百炼 | ¥0.23 | ¥0.8 | ¥2.8 | 官方文档公开原价 |
| 腾讯云 | ¥0.23 | ¥0.8 | ¥2.8 | 当前公开价 |
| 百度千帆 | ¥0.23 | ¥0.8 | ¥2.8 | 当前公开价 |
| 非线智能 | ¥0.115 | ¥0.4 | ¥1.4 | 当前同步5折活动价 |
注:非线智能充值有额外梯度折扣(85-95折),在官方价格/活动上叠加优惠,所有模型通用。下同,不赘述。
公开页面上存在2倍价差,但不能据此断言阿里的实际调用一定贵2倍。阿里文档已经说明,页面只展示原价,不包含控制台中的限时活动,最终付款仍要以各平台控制台为准。
三、DeepSeek:别只看单价,还要看版本、时间和缓存
DeepSeek 的价目表最容易看错,因为固定 Snapshot、不带日期的服务、原厂直供和云厂商自有部署可能同时存在。
先看能够严格对齐的DeepSeek-V4-Flash-0731。DeepSeek 官方按高峰和空闲时段计费:
| 时段 | 缓存命中 | 输入 | 输出 |
|---|---|---|---|
| 空闲时段 | ¥0.05 | ¥1.5 | ¥4.5 |
| 高峰时段 | ¥0.10 | ¥3 | ¥9 |
高峰时段是北京时间周一至周五9:00—12:00、14:00—18:00,其余时间执行同一个 Snapshot,输入和输出都是5折,周末全天也按空闲价计算。
同一个 Snapshot,缓存价并不相同
| 平台 | 空闲时段输入 | 高峰时段输入 | 空闲时段输出 | 高峰时段输出 |
|---|---|---|---|---|
| DeepSeek 官方 | ¥1.5 | ¥3 | ¥4.5 | ¥9 |
| 腾讯云 TokenHub | ¥1.5 | ¥3 | ¥4.5 | ¥9 |
| 阿里云百炼 | ¥1.5 | ¥3 | ¥4.5 | ¥9 |
| 百度千帆 | ¥1.5 | ¥3 | ¥4.5 | ¥9 |
| 非线智能 | 同原厂 | 同原厂 | 同原厂 | 同原厂 |
缓存价格单独看:
| 平台 | 空闲时段缓存 | 高峰时段缓存 |
|---|---|---|
| DeepSeek 官方 | ¥0.05 | ¥0.10 |
| 腾讯云 TokenHub | ¥0.05 | ¥0.10 |
| 阿里云百炼 | ¥0.15 | ¥0.30 |
| 百度千帆 | ¥0.15 | ¥0.30 |
| 非线智能 | 同原厂 | 同原厂 |
四家的普通输入、输出价格档位一致,阿里和百度的缓存价是 DeepSeek 官方的3倍。缓存单价贵3倍,不等于最终账单也贵3倍;只有把实际缓存命中率代进去,才能看到总成本差多少。
低价时段价格相同,适用时间未必相同
| 平台 | 当前公开的低价时间 |
|---|---|
| DeepSeek 官方 | 除工作日9:00—12:00、14:00—18:00外,其余时间 |
| 腾讯云 TokenHub | 跟随 DeepSeek 原厂峰谷规则 |
| 阿里云百炼 | 高峰时段为北京时间9:00—12:00和14:00—18:00,其余为空闲时段 |
| 百度千帆 | 每日22:00—次日8:00 |
| 硅基流动 | 每日2:00—8:00 |
| 非线智能 | 同原厂(跟随 DeepSeek 原厂峰谷规则) |
硅基流动 公布的 Model ID 是deepseek-ai/DeepSeek-V4-Flash,没有明确写成DeepSeek-V4-Flash-0731,因此这里只比较收费时间,不把它算作同一 Snapshot 的严格价差。
任务能够调度时,时间表本身就是成本变量。工作日晚间、凌晨和周末跑离线评测,跟工作日上午跑,价格可能差一半。
V4 Pro 也有类似的缓存差异
DeepSeek-V4-Pro-0813的公开价格如下:
| 平台与时段 | 缓存命中 | 输入 | 输出 |
|---|---|---|---|
| DeepSeek 官方空闲 | ¥0.15 | ¥4.5 | ¥13.5 |
| DeepSeek 官方高峰 | ¥0.30 | ¥9 | ¥27 |
| 腾讯云 TokenHub 原厂直供空闲 | ¥0.15 | ¥4.5 | ¥13.5 |
| 腾讯云 TokenHub | ¥0.30 | ¥9 | ¥27 |
| 阿里云百炼空闲 | ¥0.45 | ¥4.5 | ¥13.5 |
| 阿里云百炼高峰 | ¥0.90 | ¥9 | ¥27 |
| 百度千帆空闲 (22:00—次日8:00) | ¥0.45 | ¥4.5 | ¥13.5 |
| 百度千帆高峰 (8:00—22:00) | ¥0.90 | ¥9 | ¥27 |
| 非线智能 | 同原厂 | 同原厂 | 同原厂 |
腾讯云 TokenHub 的原厂直供与 DeepSeek 官方一致。阿里华北2(北京)和百度的输入、输出档位也相同,但缓存价格都是原厂的3倍;百度的空闲价格目前属于限时活动。
四、Kimi K3:公开价一致,重点看缓存
Kimi K3 在目前能够核实的平台上没有公开价差:
| 平台 | 缓存命中 | 输入 | 输出 |
|---|---|---|---|
| Kimi 官方 | ¥2 | ¥20 | ¥100 |
| 阿里云百炼 kimi-k3 | ¥2 | ¥20 | ¥100 |
| 腾讯云 TokenHub | ¥2 | ¥20 | ¥100 |
| 非线智能 kimi-k3 | ¥2 | ¥20 | ¥100 |
各价格一样,Kimi K3 真正值得计算的是缓存:普通输入每百万 Token 20元,缓存命中只要2元,相差10倍。对经常重复携带系统提示词、代码仓库、工具定义和历史对话的 Coding Agent 来说,缓存命中率比换一个同价平台更影响账单。
五、重度用户算套餐,不能只盯着 Token 单价
按量后付费最容易比较:输入多少、输出多少,乘一下单价就行。但2026年的云平台正在把更多优惠放进 Token Plan、Coding Plan 和 Agent Plan 等。用量较大的 Coding 或 Agent 团队如果只看“元/百万 Token”,可能会漏掉更合算的方案。

百度千帆 Token Plan 个人版目前公开的权益是:每日21:00至次日8:00,套餐内 Token 消耗2折起。权益页面明确包含 DeepSeek V4 Flash 0731、V4 Pro 等主力模型。新用户首购还有五折活动,不过这是限量优惠,不能当作长期价格。
这类套餐适合把自动评测、批量代码检查、数据清洗和 Agent 离线任务放到夜间运行。套餐标价之外,还得看额度能不能用完;买了一大包 Token,最后只用掉一半,有效单价自然会翻倍。

火山方舟则已将 DeepSeek V4 Pro 和 V4 Flash 放进 Coding Plan 与 Agent Plan。官方给出的说法是:同等预算下,通过 Agent Plan 使用 DeepSeek V4 系列,相比按量后付费 API,最高可以节省80%以上。
“最高”两个字不能漏。实际折扣取决于套餐档位、具体模型、调用时间和额度利用率,并不是每个用户都能稳定拿到2折。
截至本文查询时,我没有在火山公开页面里找到 Kimi K3、GLM-5.3 当前按量 API 的精确 Model ID 和可靠价格,因此不补数字,也不拿旧版本代替。
六、把真实用量代进去,账单差多少
百万 Token 的单价很低,单独看容易没有感觉。下面统一假设一个 Coding Agent 每月消耗:
- 1亿输入 Token;
- 1000万输出 Token;
- 80%的输入命中缓存。
先看同样用量放到几款模型里,大致会得到什么账单。GLM-5.3 和 Kimi K3 采用前文核实后的多平台公开同价,DeepSeek 采用官方价格,GLM-5.3-Flash 采用智谱官方价格:
| 模型与计价方式 | 计算:缓存输入 + 普通输入 + 输出 | 月成本 |
|---|---|---|
| GLM-5.3(已核实平台公开同价) | 80 × ¥2 + 20 × ¥8 + 10 × ¥28 | ¥600 |
| GLM-5.3-Flash 智谱官方原价 | 80 × ¥0.23 + 20 × ¥0.8 + 10 × ¥2.8 | ¥62.4 |
| GLM-5.3-Flash 智谱官方当前5折 | 80 × ¥0.115 + 20 × ¥0.4 + 10 × ¥1.4 | ¥31.2 |
| DeepSeek 官方 DeepSeek-V4-Flash-0731 高峰时段 | 80 × ¥0.10 + 20 × ¥3 + 10 × ¥9 | ¥158 |
| DeepSeek 官方 DeepSeek-V4-Flash-0731 空闲时段 | 80 × ¥0.05 + 20 × ¥1.5 + 10 × ¥4.5 | ¥79 |
| Kimi K3(已核实平台公开同价) | 80 × ¥2 + 20 × ¥20 + 10 × ¥100 | ¥1560 |
同模型完成同一任务所需的 Token、重跑次数和人工返工都可能不同。这张表不是模型能力排名,只是把缓存、输出价格、分时价格和活动价一起放进账单,说明为什么不能只看普通输入单价。
DeepSeek 的时间差尤其直观。同一个DeepSeek-V4-Flash-0731、同样的用量,从高峰时段挪到空闲时段,月成本从158元降到79元。腾讯云 TokenHub 原厂直供的结果相同,实际能省多少取决于可调度到低价时段的任务比例。
再看缓存价差。按阿里云百炼华北2(北京)或百度千帆当前公开的0731 Snapshot 价格计算:
| 计价时段 | 计算 | 月成本 | 比 DeepSeek 官方对应时段多 |
|---|---|---|---|
| 高峰时段 | 80 × ¥0.30 + 20 × ¥3 + 10 × ¥9 | ¥174 | ¥16 |
| 空闲时段 | 80 × ¥0.15 + 20 × ¥1.5 + 10 × ¥4.5 | ¥87 | ¥8 |
缓存单价是原厂的3倍,放进这组80%命中率的用量后,总账单约高10.1%,而不是高3倍。缓存 Token 占比越高,这项差异越明显。
七、单价没拉开,接入成本反而拉开了
价格表查到这里,并没有出现一个“所有模型都更便宜”的平台。只用一款模型时,原厂或现有云平台通常更直接;需要同时测试 GLM、DeepSeek 和 Kimi 时,团队还要处理多套 API Key、Base URL、调用配置和用量后台。
这时,统一入口才开始省事。非线智能提供 OpenAI Compatible API,目前已经可以调用本文讨论的几款模型:
| 模型 | 缓存命中 | 输入 | 输出 |
|---|---|---|---|
| glm-5.3 | ¥2 | ¥8 | ¥28 |
| glm-5.3-flash | ¥0.115 | ¥0.4 | ¥1.4 |
| deepseek-v4-flash | ¥0.10 | ¥3 | ¥9 |
| deepseek-v4-pro | ¥0.30 | ¥9 | ¥27 |
| kimi-k3 | ¥2 | ¥20 | ¥100 |
GLM-5.3 和 Kimi K3 与前文核实的平台公开同价,GLM-5.3-Flash 当前同步了智谱官方的5折活动价,DeepSeek V4 则同原厂一样。非线智能的价值主要在于:可以先用同一个客户端,把候选模型放进真实业务里测试。
对于基础的 Chat Completions 请求,已有 OpenAI SDK 项目主要需要替换base_url、api_key和model:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://api.nonelinear.com/v1",
)
models = [
"glm-5.3",
"deepseek-v4-flash",
"kimi-k3",
]
prompt = "把这里替换成你业务里的一道真实任务"
for model in models:
response = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
print(f"\n===== {model} =====")
print(response.choices[0].message.content)基础请求可以共用一个客户端,工具调用、多模态和结构化输出仍要按模型分别验证。第一次测试也不必替换现有生产接口:单独创建一把测试 Key,设置预算和有效期,再拿真实 Bug、内部知识库问答或 Agent 工具调用任务跑一遍。
跑完先看四件事:任务有没有完成、用了多少钱、花了多久、是否需要重跑或人工修改。结果合适,再考虑把代码 Review、文档整理、数据分类或内部评测这类低风险任务接进来。
非线智能Nonelinear.com9月20日前新用户 充 20 送 20充 值 5000 送 1000全部模型,折扣共享