数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

githun管网图正文:

月之暗面在2026年7月发布了Kimi K3。官方将其称为目前Kimi体系中能力最强的模型,定位覆盖长程coding、知识工作、推理和原生多模态,并强调这是一个2.8T参数、1M上下文窗口的开放3T级模型。本次我们对其API版本kimi-k3进行了全面评测,测试其在准确率、响应时间、token消耗和调用花费等关键指标上的表现。

需要说明的是,本次评测侧重中文场景下的综合能力考察,覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及coding八个板块。

kimi-k3版本表现:

  • 测试题数:约1.5万

  • 总分(准确率):75.6%

  • 平均耗时(每次调用):80s

  • 平均token(每次调用消耗的token):1962

  • 平均花费(每千次调用的人民币花费):172.4

1、新旧对决

对比上一代参照模型kimi-k2.6,kimi-k3的变化很清楚:中文综合总分冲到榜单第二,coding、法律、推理数学、金融和教育都有提升;同时,响应时间和token消耗明显下降,但调用成本因为输出单价上调而继续走高。数据如下:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】月之暗面 Kimi K3 实测:中文综合表现升至第二,耗时减半但调用成本走高引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】月之暗面 Kimi K3 实测:中文综合表现升至第二,耗时减半但调用成本走高

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

*输出价格单位: 元/百万token

  • 总分小幅提升,排名上移明显:kimi-k3总分为75.6%,相比kimi-k2.6的72.9%提升2.7个百分点,排名从第15位升至第2位。仅看ReLE中文综合准确率,kimi-k3已经进入当前总榜最靠前的一档。

  • Coding提升最突出:coding从62.6%提升至70.3%,提升7.7个百分点,是本次细分项中增幅最大的一项。这与官方强调长程coding、代码Agent和复杂工程任务的方向一致。

  • 法律和推理也有明显增量:法律与行政公务从80.3%提升至85.3%,提升5.0个百分点;推理与数学计算从82.5%提升至86.3%,提升3.8个百分点。这两个维度的提升说明kimi-k3并不是只在代码方向做优化,基础推理和中文专业任务也同步上移。

  • 金融和教育继续改善:金融从86.4%提升至89.7%,提升3.3个百分点;教育从62.4%提升至65.7%,同样提升3.3个百分点。医疗与心理健康保持在89.3%,语言与指令遵从从71.6%微升至72.5%。

  • Agent工具调用小幅回调:agent与工具调用从63.2%降至61.3%,下降1.9个百分点。

  • 响应速度改善很明显:平均耗时从175s缩短至80s,减少95s,耗时下降约54.3%。对于Kimi体系上一代旗舰来说,这是一次很关键的体验提升。

  • Token消耗接近减半:平均token从3885降至1962,减少约49.5%。这说明kimi-k3并不是通过更长输出换取总分提升,而是在更短输出中取得了更高准确率。

  • 成本仍然上行:输出价格从27.0元/百万token升至100.0元/百万token,每千次调用花费从100.4元升至172.4元,增加约71.7%。

2、横向对比

在当前主流大模型竞争格局中,kimi-k3作为月之暗面新的旗舰模型表现如何?我们从三个维度进行横向对比分析:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】月之暗面 Kimi K3 实测:中文综合表现升至第二,耗时减半但调用成本走高

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

同成本档位对比

  • 约140至180元区间看站位:kimi-k3(75.6%,172.4元)处在高端调用成本区间,主要参照对象包括qwen3.6-max-preview(75.4%,139.2元)、gpt-5.5(75.3%,158.5元)和gemini-3.5-flash(73.9%,151.2元)。在这一档里,K3总分略高于这几款模型,但成本也更高。

  • 速度不是主要优势:kimi-k3平均耗时80s,慢于gpt-5.5(15s)、gemini-3.5-flash(13s)、gemini-3.1-pro-preview(53s)和qwen3.7-max(51s),与qwen3.6-max-preview(80s)持平,但明显快于kimi-k2.6(175s)和两款高成本豆包模型。kimi-k3的速度已经比Kimi上一代旗舰实用很多,但还不是低延迟模型。

  • 向上看头部模型:kimi-k3低于qwen3.7-max(76.9%,99元),但高于doubao-seed-evolving(75.5%,304.7元)、qwen3.6-max-preview(75.4%,139.2元)、gpt-5.5(75.3%,158.5元)、gemini-3.1-pro-preview(75.2%,250.5元)、doubao-seed-2-1-pro-260628(74.8%,313.2元)和claude-opus-4.8-thinking(74.7%,238.2元)。

  • 向下看低成本替代方案:qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)、glm-5.2(73.0%,110.5元)、kimi-k2.7-code(72.6%,49.7元)和deepseek-v4-pro(71.7%,54.3元)都以更低成本提供接近但低一些的中文综合总分。

新旧模型对比

  • 月之暗面旗舰位置重新上移:kimi-k3(75.6%)相比kimi-k2.6(72.9%)提升2.7个百分点,相比kimi-k2.7-code(72.6%)提升3.0个百分点,也高于Kimi-K2.5-Thinking(70.8%)和Kimi-K2-Thinking(65.0%)。

  • 放到近期新模型里看:kimi-k3(75.6%)仅低于qwen3.7-max(76.9%),高于doubao-seed-evolving(75.5%)、qwen3.6-max-preview(75.4%)、gpt-5.5(75.3%)、doubao-seed-2-1-pro-260628(74.8%)和gpt-5.6-sol-pro(74.4%)。

开源VS闭源对比

  • 开放权重阵营的新高位:当前总分高于qwen3.5-plus(73.3%,22.9元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、kimi-k2.7-code(72.6%,49.7元)和deepseek-v4-pro(71.7%,54.3元)。需要补充的是,官方博客称完整模型权重将于2026年7月27日前发布,因此现阶段更适合把它看作即将开放权重的旗舰模型。

  • 闭源头部的压力仍在:qwen3.7-max(76.9%,99元)仍是当前总榜第一,并且成本低于kimi-k3;gpt-5.5(75.3%,158.5元)虽然总分略低,但平均耗时只有15s;gemini-3.5-flash(73.9%,151.2元)也有更低延迟。kimi-k3的优势在总分和开放生态组合,而不是速度或成本。

3、官方评测

根据月之暗面官方博客(https://www.kimi.com/blog/kimi-k3),Kimi K3是Kimi当前最强模型。官方称其总参数规模为2.8T,具备原生视觉能力和1M token上下文窗口,基于Kimi Delta Attention、Attention Residuals和Stable LatentMoE等结构,其中MoE有效激活16个专家、总专家数为896个。官方还提到,这些结构和训练配方让整体扩展效率相比Kimi K2约提升2.5倍。

工程与Coding能力

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】月之暗面 Kimi K3 实测:中文综合表现升至第二,耗时减半但调用成本走高

官方给出的核心基准主要围绕长程工程任务、终端任务和代码Agent。需要说明的是,以下为官方口径,不同模型使用的agentic harness并不完全一致,横向比较需留意测试口径差异:

  • DeepSWE:Kimi K3得分67.5,低于GPT 5.6 Sol的73.0和Claude Fable 5的70.0,高于GPT 5.5的67.0、Claude Opus 4.8的59.0和GLM-5.2的46.2。

  • Terminal Bench 2.1:Kimi K3达到88.3,接近GPT 5.6 Sol的88.8,高于Claude Fable 5和Claude Opus 4.8的84.6、GPT 5.5的83.4以及GLM-5.2的82.7。

  • Program Bench:Kimi K3达到77.8,略高于GPT 5.6 Sol的77.6和Claude Fable 5的76.8。

  • FrontierSWE:Kimi K3达到81.2,低于Claude Fable 5的86.6,高于GPT 5.6 Sol的71.3、GLM-5.2的67.3、Claude Opus 4.8的66.7和GPT 5.5的64.9。

  • SWE Marathon:Kimi K3达到42.0,高于Claude Opus 4.8的40.0、GPT 5.6 Sol的39.0、Claude Fable 5的35.0、GPT 5.5的14.0和GLM-5.2的13.0。

知识工作与Agent任务

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】月之暗面 Kimi K3 实测:中文综合表现升至第二,耗时减半但调用成本走高

官方把K3定位为从聊天走向任务完成的模型,在知识工作和Agent评测上给出了一组结果:BrowseComp为91.2,DeepSearchQA的F1为95.0,Toolathlon-Verified为73.2,MCP Atlas为84.2,Automation Bench为30.8,Office QA Pro为63.3,SpreadsheetBench 2为34.8。官方脚注还说明,若使用1M上下文且不做上下文管理,K3在BrowseComp上的得分为90.4。官方还展示了Kimi Work中的交互式研究报告、咨询报告、科学分析、Widgets和Dashboard等生产力场景。

多模态、推理与可用性

官方称K3具备原生多模态能力,并在多个推理和视觉基准上给出结果:GPQA-Diamond为93.5,HLE-Full为43.5、工具增强后为56.0;MMMU-Pro为81.6,使用python后为83.4;OmniDocBench为91.1,PerceptionBench为58.5。官方还展示了3D游戏、前端、CAD、视频编辑和视觉闭环代码迭代等案例。



非线智能官网https://nonelinear.com 已上线kimi-k3版,欢迎深度体验。 同时,非线智能API可连接超480+全球模型,支持一键Api聚合以及Api中转,提供稳定的企业级服务。 登录github账号,领20-50元体验金。接入kimi-k3就用非线智能API。

非线智能api 图 8