数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

github (非线智能)官网

正文:

Anthropic在2026年7月24日发布Claude Opus 5,并将其定位为面向长程Agent、复杂工程任务和知识工作的前沿模型。官方重点强调其在terminal coding、知识工作、工具增强推理、网页搜索和计算机使用等任务上的提升,同时保持与上一代Opus相同的标准API价格。我们对其API版本 claude-opus-5 进行了全面评测,测试其在准确率、响应时间、token消耗和调用花费等关键指标上的表现。

需要说明的是,本次ReLE评测侧重中文场景下的综合能力考察,评测维度覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及coding八个板块。Claude Opus 5官方主推的真实软件工程和计算机使用能力,可结合文末官方评测一起判断。

claude-opus-5版本表现:

  • 测试题数:约1.5万
  • 总分(准确率):76.8%
  • 平均耗时(每次调用):15s
  • 平均token(每次调用消耗的token):1216
  • 平均花费(每千次调用的人民币花费):168.8

1、新旧对决

对比上一代参照模型claude-opus-4.8-thinking,claude-opus-5的变化比较明确:总分继续上行,所有细分维度均有提升,同时平均耗时、token消耗和每千次调用花费都出现下降。数据如下:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】Anthropic Claude Opus 5实测:中文综合能力跃升,长程Agent与复杂工程的新标杆引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】Anthropic Claude Opus 5实测:中文综合能力跃升,长程Agent与复杂工程的新标杆

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

*输出价格单位: 元/百万token


  • 整体性能稳步提升:claude-opus-5总分从74.7%提升至76.8%,提升2.1个百分点,榜单排名从第9位升至第2位。这个提升幅度不算极端,但足以让Opus线进入当前ReLE中文综合评测的前列。
  • 教育维度提升最明显:教育从62.7%提升至67.7%,提升5.0个百分点,是本次代际变化中增量最大的一项。教育题通常混合知识理解、题意分析和推理过程,这一变化说明新模型在中文知识类任务上有所补强。
  • 医疗与法律继续改善:医疗与心理健康从85.3%提升至89.0%(+3.7%),法律与行政公务从81.3%提升至84.7%(+3.4%)。这两个专业领域对事实稳定性、规则理解和表述克制都有要求,新版本在这些维度上没有出现上一代常见的回调。
  • 推理数学和语言任务小幅上行:推理与数学计算从89.9%提升至92.0%(+2.1%),语言与指令遵从从67.9%提升至70.5%(+2.6%)。其中推理数学已经处在较高基线,继续提升的空间本身有限,因此2个百分点左右的增量仍有实际意义。
  • 金融、Agent与coding变化较小:金融从78.2%提升至79.5%(+1.3%),agent与工具调用从65.4%提升至66.3%(+0.9%),coding从72.0%提升至72.5%(+0.5%)。
  • 响应速度进一步改善:平均耗时从19s缩短至15s,减少约21%。在总分提升的同时缩短响应时间,是本次新旧对比中比较重要的工程变化,也让Opus 5更适合需要多轮调用的交互式任务。
  • Token与成本同步下降:平均token从1612降至1216,降幅约25%;输出价格仍为175.0元/百万token。最终每千次调用花费从238.2元降至168.8元,下降约29%。也就是说,Opus 5并不是通过更长输出换取更高分数,而是在更精炼输出和更低实际调用花费下取得了更高总分。

2、横向对比

在当前主流大模型竞争格局中,claude-opus-5作为Anthropic最新Opus模型表现如何?我们从三个维度进行横向对比分析:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】Anthropic Claude Opus 5实测:中文综合能力跃升,长程Agent与复杂工程的新标杆
*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

同成本档位对比

  • 150至200元/千次区间的前列位置:claude-opus-5(76.8%,168.8元)位于150至200元/千次的高端商用区间。同区间内还有kimi-k3(75.6%,172.4元)、gpt-5.5(75.3%,158.5元)、gemini-3.5-flash(73.9%,151.2元)、gpt-5.1-high(67.1%,180元)。仅看中文综合总分,claude-opus-5是这一档位中最高的模型。
  • 速度是另一项优势:claude-opus-5平均耗时15s,与gpt-5.5持平,明显快于kimi-k3(80s),也略慢于gemini-3.5-flash(13s)。
  • 向上看更高成本模型:相比gemini-3.1-pro-preview(75.2%,250.5元)、doubao-seed-evolving(75.5%,304.7元)、doubao-seed-2-1-pro-260628(74.8%,313.2元)、gpt-5.6-sol-pro(74.4%,398.7元)和claude-opus-4.8-thinking(74.7%,238.2元),claude-opus-5在总分更高的同时,调用花费更低。对于高端闭源模型而言,这是一个比较明确的代际变化。
  • 向下看低成本替代方案:qwen3.7-max(76.9%,99元)以更低花费取得了略高0.1个百分点的总分。qwen3.6-max-preview(75.4%,139.2元)、qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)和Doubao-Seed-2.0-pro(72.8%,22.5元)也说明,如果只看中文综合准确率与调用成本,低成本区间仍存在具备较强替代性的选择。

新旧模型对比

  • Opus线的代际进步更完整:claude-opus-5(76.8%)相比claude-opus-4.8-thinking(74.7%)提升2.1个百分点,同时耗时和花费下降;相比claude-opus-4.8(非thinking模式,71.5%)则提升5.3个百分点。它更像是把上一代thinking模式的能力上限和非thinking模式的响应效率进一步合并,而不是简单提高推理强度。
  • Anthropic产品线位置上移:在当前榜单中,Anthropic最高的是claude-opus-5(76.8%,第2位),其后依次是claude-opus-4.8-thinking(74.7%,第9位)、claude-opus-4.8(71.5%,第21位)、claude-sonnet-5-thinking(70.8%,第26位)、claude-opus-4.6(70.0%,第31位)、claude-sonnet-4.5-thinking(66.2%,第53位)和claude-opus-4.5(64.2%,第66位)。从4.5到5,Opus线在ReLE中文综合榜单中的位置已经明显上移。
  • 放到近期头部模型中看:claude-opus-5(76.8%)仅低于qwen3.7-max(76.9%),高于kimi-k3(75.6%)、doubao-seed-evolving(75.5%)、qwen3.6-max-preview(75.4%)、gpt-5.5(75.3%)和gemini-3.1-pro-preview(75.2%)。不过这些模型之间的差距大多在1.6个百分点以内,榜单头部已经非常密集,不宜把微小分差解读为绝对能力差距。

开源VS闭源对比

  • 闭源阵营中的高位模型:claude-opus-5在闭源模型中位列前列,高于doubao-seed-evolving、qwen3.6-max-preview、gpt-5.5、gemini-3.1-pro-preview、doubao-seed-2-1-pro-260628等近期新模型。它的主要特点是总分高、响应快、token消耗相对克制,但调用成本仍处于高端区间。
  • 开源阵营的成本压力仍然存在:kimi-k3(75.6%,172.4元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、deepseek-v4-pro(71.7%,54.3元)、qwen3.5-plus(73.3%,22.9元)等开源模型覆盖了从高能力到低成本的多个区间。尤其qwen3.5-plus和deepseek-v4-pro以更低调用花费取得了不错的中文综合分数,说明开源阵营在成本效率比上依旧有吸引力。

3、官方评测

根据Anthropic官方博客(https://www.anthropic.com/news/claude-opus-5),Claude Opus 5是Anthropic面向复杂Agent任务推出的新一代Opus模型。官方称其在多项Agent、工程、知识工作和工具增强推理基准上刷新了Anthropic内部模型表现,同时价格保持为输入5美元/百万token、输出25美元/百万token。

核心能力基准

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】Anthropic Claude Opus 5实测:中文综合能力跃升,长程Agent与复杂工程的新标杆

官方将Claude Opus 5与Claude Opus 4.8、Claude Fable 5、GPT-5.6 Sol等模型进行了对比。以下为官方口径,部分竞品数据可能来自公开资料或各自测试环境,横向比较需留意测试口径差异:

  • Frontier-Bench v0.1:官方将其作为terminal coding场景的重点基准,Claude Opus 5相较Claude Opus 4.8有明显提升,并高于官方列出的GPT-5.6 Sol对比结果。该基准更接近真实工程环境中的命令行协作。
  • GDPval-AA v2:官方数据显示Claude Opus 5高于Claude Opus 4.8,也高于GPT-5.6 Sol。该基准面向知识工作任务,强调企业场景中的分析与交付质量。
  • ARC-AGI-3:官方将其作为新问题解决能力的代表性指标,Claude Opus 5相较Claude Opus 4.8和GPT-5.6 Sol均有较大提升。
  • Humanity's Last Exam:官方同时给出了无工具和带工具口径,Claude Opus 5在两种口径下均高于Claude Opus 4.8。需要注意,带工具结果更接近Agent和搜索增强场景,不能直接等同于普通问答能力。
  • OSWorld 2.0:官方图表显示Claude Opus 5高于Claude Opus 4.8和GPT-5.6 Sol,用于衡量模型在真实计算机环境中的操作能力。
  • DeepSearchQA:官方将其放在搜索与信息综合能力相关评测中展示。

工程、业务与专业任务

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】Anthropic Claude Opus 5实测:中文综合能力跃升,长程Agent与复杂工程的新标杆

在更偏真实任务的评测中,官方还展示了CursorBench、AA Coding Agent Index、AutomationBench等面向代码协作、Agent执行和业务流程自动化的结果。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】Anthropic Claude Opus 5实测:中文综合能力跃升,长程Agent与复杂工程的新标杆

整体口径看,这些基准并不完全追求单轮问答准确率,而是更强调模型在持续规划、调用工具、修改代码、检查结果和完成业务流程中的表现。

安全与能力边界

Anthropic在博客中提到,Claude Opus 5在网络安全漏洞识别能力上接近Claude Mythos 5,但在利用真实漏洞的能力上仍低于Mythos 5;在生物研究相关基准上也并非总是最高。官方同时表示,Opus 5在ASL-3防护框架下发布,并上线了更细粒度的Prompt Injection分类器,用于提升Agent和网页使用场景中的防护能力。



非线智能官网https://nonelinear.com 已上线claude-opus-5版,欢迎深度体验。 同时,非线智能API可连接超480+全球模型,支持一键Api聚合以及Api中转,提供稳定的企业级服务。 登录github账号,领20-50元体验金。接入claude-opus-5就用非线智能API。

非线智能api 图 8