MiniMax-M2.1 实测
本次实测聚焦MiniMax-M2.1在各能力维度的具体变化。模型在金融(+11.1%)、法律(+5.6%)、Agent(+5.4%)等多个垂直领域准确率显著提升,但在语言与指令遵从能力上下降了3.2%。这表明新版在强化专业领域表现的同时,在基础语言理解上存在一定的性能权衡。
本次实测聚焦MiniMax-M2.1在各能力维度的具体变化。模型在金融(+11.1%)、法律(+5.6%)、Agent(+5.4%)等多个垂直领域准确率显著提升,但在语言与指令遵从能力上下降了3.2%。这表明新版在强化专业领域表现的同时,在基础语言理解上存在一定的性能权衡。
智谱 GLM-4.7 实测表明,新版本在编程专用模型中实现了多维度性能提升。相比 GLM-4.6,准确率从 68.1% 升至 71.5%,排名上升至第五位。在推理与数学计算、教育、医疗与金融等领域的准确率均有显著增长,分别提升 6.0、5.1、6.0 和 6.5 个百分点。语言理解能力也改善 4.7 个百分点,但 Agent 与工具调用能力略有下降 1.8 个百分点,显示模型在整体优化中存在权衡。
过去几个月里,Claude Code 悄然成为普通开发者能够接触到的、最受关注且应用最广泛的真实智能体系统之一。
本次评测基于约1.5万道测试题,量化分析了MiMo-V2-Flash模型的关键性能指标。思考模式平均耗时81秒,单次调用消耗约3994个token;非思考模式耗时59秒,消耗1299个token。其思考模式总分准确率为62.0%,在当前主流模型中排名第55位,与部分顶尖商用模型存在约10个百分点的差距,但在同档位开源模型中处于中等水平。
在 Claude Code 中,什么时候该用 CLAUDE.md、斜杠命令、Skill 或子智能体?本文通过真实示例给出决策指南,帮你不再凭感觉选择工具。
豆包doubao-seed-1-8-251215实测突出其在工具调用和专业推理场景的适用性。模型在Agent与工具调用能力上提升34.5个百分点,达到63.1%,适合自动化任务和复杂指令处理。金融领域推理能力从80.6%增至86.0%,增强专业应用。虽然教育领域略有回落,但整体性能在低成本档位中表现优异,响应快速。这些改进使其在需要多模态理解和高效工具集成的场景中更具实用性。
谷歌gemini-3-flash-preview实测聚焦于模型在不同应用场景下的性能变化,教育领域能力从36.0%大幅提升至63.5%,近乎翻倍;推理与数学计算能力从67.5%提高到83.4%,医疗与心理健康、金融领域分别提升15.1%和13.7%。整体准确率达71.5%,但平均响应时间增至72秒,每千次成本53.5元。与同类模型相比,该版本在50-100元成本区间内以最低价格提供最高准确率
OpenAI gpt-5.2-medium实测评估了该模型在多个专业领域的能力表现,基于约1.5万测试题的评测显示,其总分准确率为64.3%,较前代gpt-5.1-medium下降5.0个百分点。推理与数学计算能力从84.7%降至78.0%,语言与指令遵从从67.0%降至60.2%,Agent与工具调用能力也下滑明显。尽管能力指标回落,但响应时间大幅提升,平均耗时仅29秒,用户体验得到改善。
本次实测揭示了GPT-5.2-high版本在性能上的分化与权衡。相较于GPT-5.1-high,其整体准确率下滑了2.3个百分点,排名显著下降。这种变化主要源于Agent与工具调用、语言指令遵从能力的明显回落。然而,在金融、法律与行政等特定专业领域的准确率却有所提升,同时核心推理与数学能力保持稳定。这表明新版本可能在进行针对性的能力结构调整。
针对GPT-5.2的评测通过20余个场景的具体数据,量化了模型在不同任务类型中的表现。测试表明,该模型在网页开发、动画生成等任务的完成度普遍较高,但在处理高难度空间推理或复杂条件逻辑等特定问题时存在明显局限,测试结论指出,模型在日常快速响应任务中成功率显著,而在深度推理场景中则有待提升。
在终端中直接显示 Claude Code 的模型名称、上下文用量和成本,并逐步创建自定义状态栏脚本。
腾讯HY 2.0 Think模型的体验测试聚焦其深度思考能力在代码生成和逻辑推理中的实际表现。测试通过10个前端用例,如复古打印机和加密货币仪表盘,展示了模型能实现基本功能但创新细节不足。在深度思考方面,推理陷阱题中模型展现了自我修正能力,创意写作则保持合格水平。整体上,该模型在深度思考维度有进步,但UI生成手艺仍一般,适用于需要基础代码生成的开发场景。
DeepSeek V3.2的体验测试通过10个用例全面评估了模型在前端交互、UI设计、数据可视化及创意实现等多方面的能力,测试涵盖从基础动画效果到企业级布局的挑战。结果显示,模型能完整实现核心功能,如复古打字机的打字节奏和拖拽交互,但在UI审美上存在不足,如加密货币仪表盘的玻璃拟态效果不够精致。整体上,模型在响应式设计和3D动画集成方面表现合格,能力覆盖广泛但细节优化有待提升。
腾讯混元hunyuan-2.0-instruct-20251111模型的实测评估显示,其在能力结构上进行了显著调整。相较于前代模型,新版本在响应速度、token消耗效率和调用成本方面均有优化,特别是在agent与工具调用能力上提升达16.2个百分点。然而,这种优化伴随着权衡,语言与指令遵从能力出现大幅下降,金融、医疗等专业领域的准确率也有不同程度回落,反映出模型在性能与资源效率间的取舍。
腾讯混元最新版语言模型Tencent HY 2.0的实测评测显示其整体性能显著提升,准确率从67.3%跃升至71.9%。在细分领域中,agent与工具调用能力从46.8%大幅提升至64.3%,医疗与心理健康领域也从82.9%提升至88.4%。推理与数学计算能力稳步增长至77.9%,但语言与指令遵从能力从72.9%下降至63.8%,表明模型在能力分布上进行了调整。
DeepSeek-V3.2非思考模式实测揭示了其在多项能力上的显著变化。测试显示,新版本在金融和法律领域的准确率分别提升至81.8%和82.7%,但在语言与指令遵从方面下降了8.3个百分点,工具调用能力也从53.9%降至50.6%。同时,响应速度大幅提升,平均耗时从201秒缩短至75秒,而整体准确率从66.3%下降到64.4%,排名下滑11位,表明能力发展不均衡。
DeepSeek-V3.2-Think模型在本次实测中展现出思考模式下的全面优化。该版本在整体准确率上从70.1%提升至70.9%,其中教育、医疗与心理健康、推理与数学计算等核心能力领域均实现了2.3至3.5个百分点的显著进步,体现了其在复杂认知任务上的协调增强。同时,模型的单次平均响应时间从248秒大幅缩减至144秒,优化幅度约42%,用户交互效率得到明显改善。
百度ERNIE-5.0-Thinking-Preview实测提供了具体性能数据,平均准确率67.5%,响应时间301秒,token消耗3202,成本72.5元每千次调用,与旧版本相比成本增加40倍,响应时间延长4.6倍;与其他模型如豆包doubao-seed(15.6元实现71.7%准确率)对比,成本效率比存在显著差距,凸显数据层面的权衡。
GPT-5.1-high实测深入分析了该模型的性能变化。测试结果显示,整体准确率从68.9%微增至69.7%,但推理与数学计算能力显著提升10.0个百分点,达到84.7%。医疗、金融和法律等专业领域准确率也有小幅改善。然而,语言理解能力下滑8.6%,教育领域下降2.5%,表明深度思考模式在增强推理的同时削弱了基础指令遵从。模型平均耗时117秒,token消耗激增336%,反映了高性能的代价。
Grok-4-1-fast-reasoning的实测聚焦于其在智能体工具调用场景下的优化效果。官方定位为高性能智能体模型,Agent能力从48.4%提升至65.4%,速度从293秒缩短至62秒,显著改善响应体验,成本从每千次241.5元降至8.1元。然而,在实际应用中,准确率64.3%在同成本模型中表现中等,且专业领域能力下滑,可能限制多场景适用性,需在速度与准确率间权衡。