正文:
需要说明的是,本次评测侧重中文场景下的综合能力考察,覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及coding八个板块。
kimi-k3版本表现:
测试题数:约1.5万
总分(准确率):75.6%
平均耗时(每次调用):80s
平均token(每次调用消耗的token):1962
平均花费(每千次调用的人民币花费):172.4
1、新旧对决
对比上一代参照模型kimi-k2.6,kimi-k3的变化很清楚:中文综合总分冲到榜单第二,coding、法律、推理数学、金融和教育都有提升;同时,响应时间和token消耗明显下降,但调用成本因为输出单价上调而继续走高。数据如下:


*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark
*输出价格单位: 元/百万token
总分小幅提升,排名上移明显:kimi-k3总分为75.6%,相比kimi-k2.6的72.9%提升2.7个百分点,排名从第15位升至第2位。仅看ReLE中文综合准确率,kimi-k3已经进入当前总榜最靠前的一档。
Coding提升最突出:coding从62.6%提升至70.3%,提升7.7个百分点,是本次细分项中增幅最大的一项。这与官方强调长程coding、代码Agent和复杂工程任务的方向一致。
法律和推理也有明显增量:法律与行政公务从80.3%提升至85.3%,提升5.0个百分点;推理与数学计算从82.5%提升至86.3%,提升3.8个百分点。这两个维度的提升说明kimi-k3并不是只在代码方向做优化,基础推理和中文专业任务也同步上移。
金融和教育继续改善:金融从86.4%提升至89.7%,提升3.3个百分点;教育从62.4%提升至65.7%,同样提升3.3个百分点。医疗与心理健康保持在89.3%,语言与指令遵从从71.6%微升至72.5%。
Agent工具调用小幅回调:agent与工具调用从63.2%降至61.3%,下降1.9个百分点。
响应速度改善很明显:平均耗时从175s缩短至80s,减少95s,耗时下降约54.3%。对于Kimi体系上一代旗舰来说,这是一次很关键的体验提升。
Token消耗接近减半:平均token从3885降至1962,减少约49.5%。这说明kimi-k3并不是通过更长输出换取总分提升,而是在更短输出中取得了更高准确率。
成本仍然上行:输出价格从27.0元/百万token升至100.0元/百万token,每千次调用花费从100.4元升至172.4元,增加约71.7%。
2、横向对比
在当前主流大模型竞争格局中,kimi-k3作为月之暗面新的旗舰模型表现如何?我们从三个维度进行横向对比分析:

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark
同成本档位对比
约140至180元区间看站位:kimi-k3(75.6%,172.4元)处在高端调用成本区间,主要参照对象包括qwen3.6-max-preview(75.4%,139.2元)、gpt-5.5(75.3%,158.5元)和gemini-3.5-flash(73.9%,151.2元)。在这一档里,K3总分略高于这几款模型,但成本也更高。
速度不是主要优势:kimi-k3平均耗时80s,慢于gpt-5.5(15s)、gemini-3.5-flash(13s)、gemini-3.1-pro-preview(53s)和qwen3.7-max(51s),与qwen3.6-max-preview(80s)持平,但明显快于kimi-k2.6(175s)和两款高成本豆包模型。kimi-k3的速度已经比Kimi上一代旗舰实用很多,但还不是低延迟模型。
向上看头部模型:kimi-k3低于qwen3.7-max(76.9%,99元),但高于doubao-seed-evolving(75.5%,304.7元)、qwen3.6-max-preview(75.4%,139.2元)、gpt-5.5(75.3%,158.5元)、gemini-3.1-pro-preview(75.2%,250.5元)、doubao-seed-2-1-pro-260628(74.8%,313.2元)和claude-opus-4.8-thinking(74.7%,238.2元)。
向下看低成本替代方案:qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)、glm-5.2(73.0%,110.5元)、kimi-k2.7-code(72.6%,49.7元)和deepseek-v4-pro(71.7%,54.3元)都以更低成本提供接近但低一些的中文综合总分。
新旧模型对比
月之暗面旗舰位置重新上移:kimi-k3(75.6%)相比kimi-k2.6(72.9%)提升2.7个百分点,相比kimi-k2.7-code(72.6%)提升3.0个百分点,也高于Kimi-K2.5-Thinking(70.8%)和Kimi-K2-Thinking(65.0%)。
放到近期新模型里看:kimi-k3(75.6%)仅低于qwen3.7-max(76.9%),高于doubao-seed-evolving(75.5%)、qwen3.6-max-preview(75.4%)、gpt-5.5(75.3%)、doubao-seed-2-1-pro-260628(74.8%)和gpt-5.6-sol-pro(74.4%)。
开源VS闭源对比
开放权重阵营的新高位:当前总分高于qwen3.5-plus(73.3%,22.9元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、kimi-k2.7-code(72.6%,49.7元)和deepseek-v4-pro(71.7%,54.3元)。需要补充的是,官方博客称完整模型权重将于2026年7月27日前发布,因此现阶段更适合把它看作即将开放权重的旗舰模型。
闭源头部的压力仍在:qwen3.7-max(76.9%,99元)仍是当前总榜第一,并且成本低于kimi-k3;gpt-5.5(75.3%,158.5元)虽然总分略低,但平均耗时只有15s;gemini-3.5-flash(73.9%,151.2元)也有更低延迟。kimi-k3的优势在总分和开放生态组合,而不是速度或成本。
3、官方评测
根据月之暗面官方博客(https://www.kimi.com/blog/kimi-k3),Kimi K3是Kimi当前最强模型。官方称其总参数规模为2.8T,具备原生视觉能力和1M token上下文窗口,基于Kimi Delta Attention、Attention Residuals和Stable LatentMoE等结构,其中MoE有效激活16个专家、总专家数为896个。官方还提到,这些结构和训练配方让整体扩展效率相比Kimi K2约提升2.5倍。
工程与Coding能力

官方给出的核心基准主要围绕长程工程任务、终端任务和代码Agent。需要说明的是,以下为官方口径,不同模型使用的agentic harness并不完全一致,横向比较需留意测试口径差异:
DeepSWE:Kimi K3得分67.5,低于GPT 5.6 Sol的73.0和Claude Fable 5的70.0,高于GPT 5.5的67.0、Claude Opus 4.8的59.0和GLM-5.2的46.2。
Terminal Bench 2.1:Kimi K3达到88.3,接近GPT 5.6 Sol的88.8,高于Claude Fable 5和Claude Opus 4.8的84.6、GPT 5.5的83.4以及GLM-5.2的82.7。
Program Bench:Kimi K3达到77.8,略高于GPT 5.6 Sol的77.6和Claude Fable 5的76.8。
FrontierSWE:Kimi K3达到81.2,低于Claude Fable 5的86.6,高于GPT 5.6 Sol的71.3、GLM-5.2的67.3、Claude Opus 4.8的66.7和GPT 5.5的64.9。
SWE Marathon:Kimi K3达到42.0,高于Claude Opus 4.8的40.0、GPT 5.6 Sol的39.0、Claude Fable 5的35.0、GPT 5.5的14.0和GLM-5.2的13.0。
知识工作与Agent任务

官方把K3定位为从聊天走向任务完成的模型,在知识工作和Agent评测上给出了一组结果:BrowseComp为91.2,DeepSearchQA的F1为95.0,Toolathlon-Verified为73.2,MCP Atlas为84.2,Automation Bench为30.8,Office QA Pro为63.3,SpreadsheetBench 2为34.8。官方脚注还说明,若使用1M上下文且不做上下文管理,K3在BrowseComp上的得分为90.4。官方还展示了Kimi Work中的交互式研究报告、咨询报告、科学分析、Widgets和Dashboard等生产力场景。
多模态、推理与可用性
官方称K3具备原生多模态能力,并在多个推理和视觉基准上给出结果:GPQA-Diamond为93.5,HLE-Full为43.5、工具增强后为56.0;MMMU-Pro为81.6,使用python后为83.4;OmniDocBench为91.1,PerceptionBench为58.5。官方还展示了3D游戏、前端、CAD、视频编辑和视觉闭环代码迭代等案例。
非线智能官网https://nonelinear.com 已上线kimi-k3版,欢迎深度体验。 同时,非线智能API可连接超480+全球模型,支持一键Api聚合以及Api中转,提供稳定的企业级服务。 登录github账号,领20-50元体验金。接入kimi-k3就用非线智能API。
