数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

github (非线智能)官网正文:

阿里通义千问新发布Qwen3.8-Max,并将其定位为Qwen家族当前最高能力模型。官方介绍中,Qwen3.8-Max基于Qwen3.5架构基础扩展到2.4T参数、95B激活参数,重点面向代码、真实工作流、研究任务和长程Agent任务;同时,官方称这也是首个将开放权重的Qwen-Max级模型,权重计划在发布后一周开放。我们对其API版本qwen3.8-max进行了全面评测,测试其在准确率、响应时间、token消耗和调用花费等关键指标上的表现。

需要说明的是,本次评测侧重中文场景下的综合能力考察,评测维度覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及coding八个板块。Qwen3.8-Max官方主推的多天自主编码、真实工作流、长程任务和多模态Agent能力,可结合文末的官方评测数据形成更完整的判断。

qwen3.8-max版本表现:

  • 测试题数:约1.5万
  • 总分(准确率):75.4%
  • 平均耗时(每次调用):67s
  • 平均token(每次调用消耗的token):3175
  • 平均花费(每千次调用的人民币花费):107.3

1、新旧对决

对比上一代参照模型qwen3.7-max,qwen3.8-max在ReLE中文综合评测中的变化并不是继续上行,而是总分回调、响应变慢、调用花费小幅上升。数据如下:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】阿里 Qwen3.8-Max 实测:转向长程Agent进化,中文综合评测遭遇“回调”引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】阿里 Qwen3.8-Max 实测:转向长程Agent进化,中文综合评测遭遇“回调”

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

*输出价格单位: 元/百万token

  • 整体性能出现回调:qwen3.8-max总分从76.9%降至75.4%,下降1.5个百分点,榜单排名从第1位降至第6位。
  • Coding回调最明显:coding从73.3%降至68.7%(-4.6个百分点),是所有细分维度中下降幅度最大的一项。这一点和官方强调代码智能体能力增强的叙事并不完全一致,原因可能在于ReLE coding更偏中文综合题库中的代码相关任务,而官方更多展示真实仓库、长程执行和工具环境下的代码能力。
  • Agent与金融也有下降:agent与工具调用从68.8%降至66.4%(-2.4个百分点),金融从89.1%降至86.9%(-2.2个百分点)。
  • 教育和推理小幅回调:教育从65.4%降至63.7%(-1.7个百分点),推理与数学计算从84.7%降至83.6%(-1.1个百分点)。两项下降幅度不大,但叠加后对总分产生了影响。
  • 医疗基本持平:医疗与心理健康从89.0%微降至88.8%(-0.2个百分点),基本保持上一代水平。
  • 法律和语言略有改善:法律与行政公务从85.3%提升至86.0%(+0.7个百分点),语言与指令遵从从71.8%提升至72.6%(+0.8个百分点)。
  • 响应时间拉长:平均耗时从51s增至67s,增加16s,约31%。这可能与官方强调的长程任务形态有关,但无法由本次数据直接确认。
  • Token和成本上升:平均token从2920增至3175,增加约8.7%;输出价格仍为36.0元/百万token。最终每千次调用花费从99元升至107.3元,增加约8.4%。

2、横向对比

在当前主流大模型竞争格局中,qwen3.8-max作为阿里最新Max级模型表现如何?我们从三个维度进行横向对比分析:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】阿里 Qwen3.8-Max 实测:转向长程Agent进化,中文综合评测遭遇“回调”

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

同成本档位对比

  • 90至130元/千次区间的位置:qwen3.8-max(75.4%,107.3元)位于商用高端区间。同档位可比模型包括qwen3.7-max(76.9%,99元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、gpt-5.4-high(72.6%,122.3元)、claude-opus-4.8(71.5%,99.4元)、claude-sonnet-5-thinking(70.8%,93.7元)、claude-opus-4.6(70.0%,96.5元)、gpt-5.2-high(67.3%,94.1元)和grok-4.5(70.0%,125.7元)。在这个区间内,qwen3.8-max仍处于前列,但低于上一代qwen3.7-max。
  • 与上一代同价位旗舰相比:qwen3.8-max(75.4%,67s,107.3元)相比qwen3.7-max(76.9%,51s,99元),总分低1.5个百分点,平均耗时更长,调用花费也更高。仅从ReLE中文综合评测看,qwen3.7-max仍是Qwen Max线里更优的参照。
  • 向上看更高成本模型:claude-opus-5(76.8%,168.8元)、kimi-k3(75.6%,172.4元)、doubao-seed-evolving(75.5%,304.7元)、gpt-5.5(75.3%,158.5元)、gemini-3.1-pro-preview(75.2%,250.5元)都处在更高或相近的头部区间。qwen3.8-max的总分与这些模型差距很小,且花费明显低于多数高成本闭源模型。
  • 向下看低成本替代方案:qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)、Doubao-Seed-2.0-pro(72.8%,22.5元)、kimi-k2.7-code(72.6%,49.7元)、deepseek-v4-pro(71.7%,54.3元)以更低花费提供了接近的中文综合准确率。

新旧模型对比

  • 阿里产品线仍保持头部密度:当前榜单中,Qwen系的qwen3.7-max(76.9%,第1位)、qwen3.6-max-preview(75.4%,第5位)、qwen3.8-max(75.4%,第6位)共同占据头部;往下还有qwen3.7-plus(73.5%,第13位)、qwen3.5-plus(73.3%,第14位)、Qwen3.5-122B-A10B(70.9%,第25位)、qwen3.6-plus(70.7%,第28位)等模型。即便qwen3.8-max出现回调,Qwen产品线在ReLE中文榜单中的整体密度仍然较高。
  • 近期头部模型差距很小:qwen3.8-max(75.4%)低于qwen3.7-max(76.9%)、claude-opus-5(76.8%)、kimi-k3(75.6%)和doubao-seed-evolving(75.5%),与qwen3.6-max-preview(75.4%)持平,略高于gpt-5.5(75.3%)和gemini-3.1-pro-preview(75.2%)。榜单前十的分差较密集,单次排名变化不宜被解读为绝对能力差距。

开源VS闭源对比

  • 商业API中的高位模型:截至本次评测,qwen3.8-max仍以商业API形式提供,官方已预告后续开放权重。在当前商用模型中,它略高于gpt-5.5(75.3%,158.5元)、gemini-3.1-pro-preview(75.2%,250.5元)、doubao-seed-2-1-pro-260628(74.8%,313.2元)和claude-opus-4.8-thinking(74.7%,238.2元)。
  • 开源阵营带来的压力:kimi-k3(75.6%,172.4元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、qwen3.5-plus(73.3%,22.9元)、deepseek-v4-pro(71.7%,54.3元)等开源模型覆盖了多个成本区间。

3、官方评测

根据Qwen官方博客(https://qwen.ai/blog?id=qwen3.8),Qwen3.8-Max的核心定位是"coding and cowork":不仅回答问题,还要在更长周期内完成代码、工作流、研究和多模态任务。

模型规模与发布信息

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】阿里 Qwen3.8-Max 实测:转向长程Agent进化,中文综合评测遭遇“回调”

官方披露,Qwen3.8-Max基于Qwen3.5架构基础扩展到2.4T参数,其中95B为激活参数。官方将其描述为Qwen家族当前最高能力模型,主要提升方向包括coding、work、research和long-horizon tasks。模型已经可以通过QwenCloud调用,官方称Max级权重将于发布后一周在Hugging Face和ModelScope开放。

Coding与长程代码任务

官方用三个长程编码案例来说明Qwen3.8-Max的能力边界:

  • 自主构建oh-my-cli项目:官方称Qwen3.8-Max在10天以上的自主编码运行中,从零创建并持续演化一个self-evolving harness。截至2026年7月30日,项目在约16天完全自主运行后累计265次commit、127个PR和151个issue。
  • 复现实验并改进论文方法:官方给定论文"Unified Data Selection for LLM Reasoning",要求模型从零复现实验并尝试改进。Qwen3.8-Max在约125小时内写出约7600行代码、执行超过1100次动作、运行33轮GPU训练;随后在AIME24上把复现基线49.58%提升到52.29%,提升2.71个百分点。
  • 参加真实算法竞赛:官方将模型投入阿里云天池WWW2025多模态对话意图识别挑战。模型在24小时内完成方案,经过45次提交后准确率从0.60提升至0.853,最终超过526支参赛队伍中的458支。

工作流、长程任务与多模态Agent

在"Work"部分,官方强调通过扩展真实RL环境和计算规模,提升模型在QwenWork、Claude Code、Codex、OpenClaw、Hermes等不同harness中的工作能力。博客中还展示了合规审查、UI原型设计、菜单开发、结构工程、康复治疗可视化和体育数据分析等代表性任务。

长程任务方面,官方给出两个重点案例:其一是数字芯片设计任务,Qwen3.8-Max在约500轮、71次评估、13个关键里程碑中,将GCD/RSA硬件加速器的首个可用设计从8298个gate优化到678个gate;其二是365天电商经营模拟,模型在包含12类店铺、60个商品类别、近600个供应商和7000个商品的环境中经营店铺,最终余额达到416252元,相比第二名GLM 5.2高38%,相比Qwen3.7-Max提升152%。

多模态方面,官方称Qwen3.8-Max可以处理超过200页的金融报告、超过100小时的视频内容,并将文档、视频和界面截图转化为结构化报告、记忆图谱或可运行的前端项目。这类能力在ReLE当前中文文本评测中覆盖有限,因此更适合作为官方能力边界的补充信息。

官方基准表与接口信息

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】阿里 Qwen3.8-Max 实测:转向长程Agent进化,中文综合评测遭遇“回调”

官方给出了较完整的Benchmark表。为避免重复官方博客全文,这里只摘取与模型定位关系较近的几组结果:

  • Coding Agent:Terminal Bench 2.1为86.6,SWE-bench Pro为67.7,FrontierSWE为73.5,PaperBench为93.0。
  • General Agent:CoWorkBench为74.8,SkillsBench为70.2,Toolathlon Verified Pass@1为72.5。
  • 多模态与视觉Agent:MMMU-Pro为82.3,OSWorld-Verified为86.1,OmniDocBench 1.5为92.1,OCR-Bench-V2为74.2/68.3。

接口方面,Qwen3.8-Max支持QwenCloud调用,兼容OpenAI chat completions、responses API以及Anthropic API协议;官方支持reasoning_effort参数,包含xhigh、medium、low三档,其中xhigh为默认档。官方还说明preserve_thinking默认开启,并在示例中给出100万上下文窗口、文本和图像输入、并行工具调用等配置。

非线智能官网 https://nonelinear.com/static/models.html 已上线qwen3.8-max,支持一键接入(附接入代码)。同时,非线智能API可连接超480+全球模型,支持一键Api聚合以及Api中转,提供稳定的企业级服务。 登录github账号,领20-50元体验金。接入qwen3.8-max就用非线智能API。

快速接入代码如下:

from openai import OpenAI

client = OpenAI(     base_url="https://api.nonlinear.com/v1",     api_key="YOUR_API_KEY", )
response = client.chat.completions.create(     model="qwen3.8-max",     messages=[         {"role": "user", "content": "分析大型代码库,规划并执行修复方案"}     ], )
print(response.choices[0].message.content)



非线智能api 图 8