正文:
qwen3.8-flash版本表现:
- 测试题数:约1.5万
- 总分(准确率):74.0%
- 平均耗时(每次调用):64s
- 平均token(每次调用消耗的token):3904
- 平均花费(每千次调用的人民币花费):10
1、新旧对决
对比上一代参照模型qwen3.5-flash,qwen3.8-flash在ReLE中文综合评测中的变化很明确:总分上移,排名明显前进,响应时间和token消耗明显下降,实际每千次调用花费基本保持在同一档位。数据如下:


*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark
*输出价格单位: 元/百万token
- 总分上升:qwen3.8-flash总分从68.9%提升至74.0%,提升5.1个百分点,榜单排名从第43位升至第15位。对于Flash线来说,这次变化把模型从中游位置推到了榜单前十五。
- 推理数学和教育提升最突出:推理与数学计算从79.0%提升至87.7%(+8.7个百分点),教育从56.5%提升至64.9%(+8.4个百分点)。
- 医疗和法律也有所提升:医疗与心理健康从80.7%提升至86.8%(+6.1个百分点),法律与行政公务从80.3%提升至86.3%(+6.0个百分点)。这两类专业场景对错误率更敏感,实际使用时仍需要结合人工复核;这里只能说明模型在相关中文题库上的准确率提高。
- 语言指令和工具调用改善较温和:语言与指令遵从从66.5%提升至72.2%(+5.7个百分点),agent与工具调用从62.9%提升至66.5%(+3.6个百分点)。其中语言指令接近整体增幅,Agent工具调用则仍不是最突出的分项。
- 金融和coding微幅变化:金融从77.1%提升至78.8%(+1.7个百分点),coding从58.9%提升至60.5%(+1.6个百分点)。这两项虽未回调,但增幅明显低于推理、教育、医疗和法律。
- 响应时间明显缩短:平均耗时从344s降至64s,减少280s,耗时约为上一代的19%。这对高频调用、交互式问答和需要较快返回的业务场景更有意义。
- Token消耗下降:平均token从5414降至3904,减少1510,降幅约28%。与此同时,输出价格从2.0元/百万token升至2.7元/百万token,但每千次调用花费从10.4元降至10元。
2、横向对比
在当前主流大模型竞争格局中,qwen3.8-flash作为阿里Flash线的新版本表现如何?我们从三个维度进行横向对比分析:

同成本档位对比
- 9至11元区间的高位模型:qwen3.8-flash(74.0%,10元)处在每千次调用约10元的低花费区间。同区间的直接参照包括qwen3.5-flash(68.9%,10.4元)和step-3.5-flash(64.0%,9.8元)。在这一组中,qwen3.8-flash的中文综合总分更高。
- 向下看更低花费模型:Doubao-Seed-2.0-mini(69.3%,7元)、Doubao-Seed-2.0-lite(70.5%,5.4元)和deepseek-v4-flash(68.8%,4.9元)调用花费更低,但总分与qwen3.8-flash相差3.5至5.2个百分点。对于极低预算调用,这些模型仍可作为备选;如果希望在较低花费下保持更高中文综合准确率,qwen3.8-flash的位置更靠上。
- 和上一代Flash相比:qwen3.8-flash(74.0%,64s,10元)相比qwen3.5-flash(68.9%,344s,10.4元),总分高5.1个百分点,耗时明显缩短,花费基本持平。
- 向上看Plus线模型:qwen3.7-plus(73.5%,31.7元)和qwen3.5-plus(73.3%,22.9元)的总分都略低于qwen3.8-flash,但每千次调用花费更高。
- 速度位置居中:qwen3.8-flash平均耗时64s,快于qwen3.5-flash(344s)、Doubao-Seed-2.0-lite(276s)和Doubao-Seed-2.0-mini(343s),但慢于deepseek-v4-flash(49s)、step-3.5-flash(36s)以及部分低延迟闭源模型。它的速度优势主要体现在相对上一代和部分低花费模型,而不是全榜低延迟第一梯队。
新旧模型对比
- Flash线位置明显上移:qwen3.5-flash(68.9%,第43位)此前更多承担低花费调用角色;qwen3.8-flash(74.0%,第15位)则进入了更靠近头部的区域。结合每千次调用花费基本持平,这次代际变化同时体现在分数、响应时间和token消耗上。
- 阿里产品线主要参照:当前榜单中,阿里系可重点参考qwen3.7-max(76.9%,99元)、qwen3.6-max-preview(75.4%,139.2元)、qwen3.8-max(75.4%,107.3元)、qwen3.8-flash(74.0%,10元)、qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)和qwen3.5-flash(68.9%,10.4元)。qwen3.8-flash的出现,使阿里在10元档附近多了一个更高分的选择。
开源/商用对比
- 商用低花费档的上沿:在商用模型中,qwen3.8-flash高于gemini-3-flash-preview(71.2%,53.5元)、Doubao-Seed-2.0-lite(70.5%,5.4元)和Doubao-Seed-2.0-mini(69.3%,7元)。它仍低于gemini-3.7-flash(75.4%,27.8元)等模型,但花费显著更低。
- 开源模型的参照压力仍在:kimi-k3(75.6%,172.4元)、glm-5.3(75.2%,134.9元)和deepseek-v4-pro(74.9%,94.1元)在总分上高于qwen3.8-flash,但调用花费也处在更高区间。另一方面,deepseek-v4-flash(68.8%,4.9元)花费更低但总分差距较大。因此,是否选择qwen3.8-flash,取决于任务上限、响应速度和调用花费的权重。
3、官方评测
根据Qwen官方博客(https://qwen.ai/blog?id=qwen3.8-flash-next),以下仅整理官方公布的评测结果。由于官方基准涉及不同harness、公开分数和内部评测集,横向比较需留意测试口径差异。
文本、代码与Agent基准

官方将Qwen3.8-Flash-Next与Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash-0731和Claude-Opus-4.6(Max)等模型进行了对比。摘取几项关键结果如下:
- 代码与软件工程:DeepSWE 1.1为58.7,SWE-bench Pro为62.5,SWE-bench Multilingual为81.0,LiveCodeBench v6为91.9。
- Agent任务:CoWorkBench为73.9,JobBench为55.7,Toolathlon Verified Pass@1为73.5,Agents' Last Exam为Pass@1 24.3、Score 51.2。
- 通用与推理:IFBench为81.3,GPQA Diamond为91.7,HLE为35.9。
官方说明中,DeepSWE 1.1使用Claude Code和mini-SWE-agent harness,SWE-bench Pro除Claude-Opus-4.6(Max)使用官方公开分数外,其余模型使用Claude Code harness;HLE由GPT-4o评判。这些口径会影响不同模型之间的直接比较。
多模态与视觉Agent基准

官方给出的Vision Language结果中,Qwen3.8-Flash-Next在ClawEval-MM上为Pass@3 64.4、Average 60.4;RecreationBench为49.9;AndroidWorld为84.5;OSWorld 2.0为Binary 19.4、Partial 52.3;Vision2Web为64.0。
通用多模态部分,官方公布的结果包括ERQA 72.3、LVBench 76.6、RealWorldQA 88.5、MathVision Without CI 90.6 / With CI 95.7、CharXiv(RQ)Without CI 84.6 / With CI 90.6。官方说明中,ClawEval-MM按Pass@3和三次平均分报告,OSWorld 2.0按binary和partial两种分数报告,MathVision与CharXiv则区分是否使用CI。
Base模型基准

官方还比较了Qwen3.8-Flash-Next-Base与Qwen3.8-27B-Base、Qwen3.7-Plus-Base。官方表中,Qwen3.8-Flash-Next-Base在14项基准中的8项取得同组最高结果,包括MMLU-Pro 73.23、SuperGPQA 51.36、BBH 90.87、GSM8K 93.29、EvalPlus 78.76、SWEBench-Pretrain 50.99、MGSM 89.33和MMMLU 84.86。
在其余项目中,官方表显示Qwen3.8-Flash-Next-Base与Qwen3.7-Plus-Base接近,但并非全部最高:MMLU为90.36,MMLU-Redux为90.68,GPQA为51.42,MATH为72.78,MultiPL-E为79.09,INCLUDE为78.40。
非线智能官网 https://nonelinear.com/static/models.html 已上线qwen3.8-flash,支持一键接入(附接入代码),添加客服 发送 体验金,可享20-50元首充奖励,欢迎对比体验。

快速接入代码如下:
from openai import OpenAI
client = OpenAI(
base_url="https://api.nonlinear.com/v1",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="qwen3.8-flash",
messages=[
{"role": "user", "content": "分析一份中文产品需求文档,提取关键功能和风险点"}
],
)
print(response.choices[0].message.content)