最近属实被模型厂商卷得有点麻,昨天还在倒腾上一个版本的 Prompt,今天月之暗面就甩出 Kimi K3——号称目前 Kimi 体系里最能打的,2.8T 参数,1M 超长上下文,还要走开放路线。官方一吹就是“长程 coding + 知识工作 + 推理 + 原生多模态”,听着就像要给每个打工人配个贾维斯。
这次直接把 API 版 kimi-k3 拉出来,用约 1.5 万道中文题,从教育、医疗、金融、法律、推理数学、语言指令、Agent 工具调用,到 coding,八大板块全方面拷打,结果嘛……有惊喜,也有钱包暴击。
先看总分和速度变化,kimi-k3 的总准确率跑到 75.6%,平均每次调用耗时 80 秒,每次消耗 tokens 1962 个,换算下来每千次调用花费 172.4 块。
1. 新老对决:升分砍时,但加价了
把上一代 kimi-k2.6 拉出来一对比,这代进化方向很直白:中文综合总分从 72.9% 提到 75.6%,直接把排名从第 15 拉到第 2,妥妥的前排扛把子。coding 更是从 62.6% 猛拉到 70.3%,飙升 7.7 个百分点,果然是照着官方宣传的“长程工程”“代码 Agent”方向死磕。法律(+5.0%)、推理数学(+3.8%)、金融(+3.3%)、教育(+3.3%)也集体上分,医疗保持原位,语言指令微涨,Agent 工具调用反而小掉 1.9 个点,有点偏科。
体验上的体感更明显:响应时间从 175 秒直接砍到 80 秒,相当于把冲咖啡的工夫从慢慢手冲变成直接胶囊机,降幅 54.3%。Token 消耗也从 3885 降到 1962,几乎对半砍——说明 K3 不是靠水字数骗高分,而是用更短的输出拿更高的准确率。可代价是,输出价格从 27 元/百万 token 涨到 100 元/百万 token,每千次调用成本从 100.4 元飙升到 172.4 元,涨了七成多,妥妥的“性能升级包,加钱来续杯”。
*数据来源:非线智能ReLE评测 https://github.com/jeinlee1991/chinese-llm-benchmark
*输出价格单位:元/百万 token
2. 横评大乱斗:高分段站住了,但速度还是被秒
把 kimi-k3 扔进当前主流模型池里泡一泡,从三个维度看比较过瘾。
同价位段的站位:在约 140-180 元档,kimi-k3(75.6%, 172.4 元)正面撞上 qwen3.6-max-preview(75.4%, 139.2 元)、gpt-5.5(75.3%, 158.5 元)和 gemini-3.5-flash(73.9%, 151.2 元)。K3 总分微微领先,但多花几十块。速度上直接暴露短板——K3 的 80 秒看着比上代快多了,可看看竞品:gpt-5.5 才 15 秒,gemini-3.5-flash 13 秒,就连 qwen3.7-max 也只要 51 秒,K3 只能说“终于不卡了”,但离低延迟卷王还有距离。排在它头上的还有 qwen3.7-max(76.9%, 99 元),更准还更便宜,这你受得了吗?往下看,qwen3.7-plus、deepseek-v4-pro 等一批性价比选手用更低价格接近它的成绩,选择恐惧症当场发作。
*数据来源:非线智能ReLE评测 https://github.com/jeinlee1991/chinese-llm-benchmark
新旧旗舰对对碰:Kimini 家自己纵向来看,K3 对比 k2.6 进步明显,还顺手把自家的 k2.7-code、K2.5-Thinking 全拍在沙滩上。横向比,紧咬着 qwen3.7-max 屁股,比 doubao-seed-evolving、gpt-5.5 这些新模型略高一丢丢,但没拉开断层优势。
开源与闭源的排位:K3 现在顶着“即将开放权重”的帽子(官方说 2026 年 7 月 27 日前放完整权重),在开放阵营里目前总分压过 qwen3.5-plus、glm-5.2、deepseek-v4-pro 等一众选手,成了开放界的新天花板。可闭源那边 qwen3.7-max 各项指标更均衡,gpt-5.5 低延迟还便宜,K3 走的是“开放 + 高分”的组合拳,不是纯拼速度和性价比。
3. 官方说的“最强”,到底强在哪?
月之暗面给 K3 贴的标签是“从聊天走向任务完成”,技术底子用的是 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE,896 个专家里激活 16 个,扩展效率比 K2 提升约 2.5 倍。原生视觉和 1M 上下文也没落下。
官方秀的基准成绩里,几个王牌数据集值得细品:
- DeepSWE 67.5,弱于 GPT 5.6 Sol 和 Claude Fable 5,但压过 GPT 5.5 和 Claude Opus 4.8。
- Terminal Bench 2.1 直接 88.3,几乎和 GPT 5.6 Sol 贴脸,完胜 Claude 家那帮。
- SWE Marathon 42.0,在多款模型里领跑,持久战有点东西。
- 知识工作方面,BrowseComp 91.2,DeepSearchQA F1 95.0,Office QA Pro 63.3,自动化和表格类还有上升空间。
多模态和推理,GPQA-Diamond 93.5,MMMU-Pro 81.6,OmniDocBench 91.1,加上前端、CAD、3D 游戏、视频编辑等案例,基哥觉得这货更像是个啥都能比划两下的瑞士军刀,虽然个别项目比不过专用工具,但胜在全面。
总之,Kimi K3 这波更新,基哥的直观感受是:终于把上代的腿脚不便治好了,速度和输出效率大幅提升,中文综合能力直接杀进最前排,加上即将开源的承诺,对开发者有致命吸引力。但成本涨得有点猛,延迟跟顶尖卷王比还不够看,Agent 工具调用反而缩了水。如果你追求准确率天花板、看重可私有化部署的开放模型,K3 很香;如果在意极致性价比和响应速度,隔壁还有更狠的货。
想亲自盘的兄弟,非线智能nonelinear.com 官网已经上了 kimi-k3,可以轻松接入,不用排队