数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

github (非线智能)官网正文:

生图模型更新很快,单看官方 Demo 很难判断真实可用性。本期把 OpenAI、阿里、Google、智谱和豆包的 12 组配置放进同一套任务,重点看文字准确性、复杂指令、UI、多人构图、商业海报、速度与成本。

这 12 组里包含同一个 gpt-image-2 的 low、medium 两档,因此严格来说是 11 个模型、12 组配置。这样安排也正好能回答一个实用问题:同一个模型提高质量档位,究竟值不值。

参与的完整模型 ID 包括:OpenAI 的 gpt-image-2(low、medium);阿里的 qwen-image-3.0-proqwen-image-2.0-proqwen-image-2.0wan2.7-image;Google 的 gemini-3.1-flash-image-previewgemini-3-pro-image-previewgemini-2.5-flash-image;智谱的 glm-image;以及豆包的 doubao-seedream-5-0-pro-260628Doubao-Seedream-5.0-lite

一句话结论

  • GPT-Image-2 medium 最可控:精确文字、长指令、UI 和商业物料都很稳;low 更适合低成本试稿,但本轮漏项和改写更多。
  • Gemini 3 Pro 最均衡:本轮画质、文字、复杂语义都接近第一梯队,速度还很稳定,但在 usage 已返回成本的配置中平均成本最高。
  • Gemini 3.1 Flash 最像“高效全能型”:平均 13.4 秒,文字、UI、分镜和海报没有明显短板。
  • Seedream 5.0 Lite 是本轮惊喜:比 Pro 更快、更便宜,精确文字和结构化任务反而更稳;Pro 仍胜在摄影感和视觉冲击力。
  • Wan 2.7 和 Qwen-Image 3.0 Pro 各有优势:Wan 的商业设计与信息图很强;Qwen 3.0 Pro 的 UI、图解和整体完成度高,但平均耗时最慢。

评测方法

本期每组配置都跑同一批 13 个文生图任务,覆盖:

  • 文字渲染:英文音乐节门票、中英咖啡海报、耳机爆炸图
  • 长指令:6 格电影分镜、4 页产品发布会幻灯片
  • UI 生成:iOS 健身 App、电商后台 Dashboard
  • 多主体与信息图:10 人办公室群像、水循环科学图解
  • 图文混合:夜景城市条漫、美食摄影文字叠加
  • 商业设计:极简专辑封面、运动鞋促销海报

评分看 5 个维度,每项满分 5 分:

  • 指令遵循:主体、风格、构图和指定元素是否到位。
  • 画面质量:清晰度、光影、细节、构图和整体审美。
  • 复杂语义:数量、空间关系、信息层级和多约束是否正确。
  • 文字能力:中英文、数字、标签、价格与 UI 文案是否准确可读。
  • 稳定性:这里实际衡量最终输出完整性,即是否拿到可评分图片、是否严重偏题或尺寸异常;网络、网关、限流等调用重试不计入模型得分。

各模型按接口支持的常用档位生成:多数约为 1K,Seedream Lite 使用接口最低支持的 2K,GLM-Image 为 1280×1280,另有少数模型采用接口默认规格。成本只反映本轮实际请求规格,不等同于同分辨率的官方价格横比。

主观评分时,每组配置的每个用例只取 1 张样本;耗时与成本按同配置的 13 次成功调用统计。因此分数更适合观察能力侧重点,不建议把它当作长期稳定结论。

客观数据:速度差距比想象中更大

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
12组模型配置客观数据

本轮纳入对比的 12 组配置最终都获得了 13 张可评分结果,因此在最终完成数上没有拉开差距;这不等同于一次调用成功率。真正拉开差距的是速度、成本和结果可用性。

速度最快的一组是 Gemini 3.1 Flash,平均 13.4 秒;Gemini 2.5 Flash 为 14.7 秒,Qwen-Image 2.0 为 17.8 秒。需要注意的是,Qwen 2.0 和 Qwen 2.0 Pro 虽然平均值很好看,最慢单张分别达到 141.6 秒和 148.0 秒,波动明显。Gemini 3 Pro 的平均耗时是 23.1 秒,最快 20.2 秒、最慢 26.9 秒,反而是本轮最稳定的速度曲线之一。

GPT-Image-2 从 low 提升到 medium 后,平均耗时从 32.2 秒增加到 63.2 秒,接口返回的平均成本从约人民币 ¥0.046 增加到 ¥0.403。也就是耗时接近翻倍,成本约为 8.7 倍;换来的则是精确文字、长指令和 UI 完成度的明显提升。

豆包内部的差异也很直观:Seedream 5.0 Lite 平均 51.4 秒、约 ¥0.22/张;Seedream 5.0 Pro 平均 91.5 秒、约 ¥0.30/张。Lite 不只是便宜和快,本轮在结构化任务里也更听话。

成本表里“未返回”不等于免费,只表示接口 usage 没有给出可直接采用的成本。本轮 qwen-image-3.0-pro 仍处于内测阶段,测试成本为 0,正式价格要以平台上线规则为准。

能力评分:高质量不只等于“更清晰”

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
12组模型配置能力评分

这张表最值得看的不是合计,而是不同模型在哪一列掉分。

GPT-Image-2 medium 的提升不只是纹理更细。音乐节门票、发布会幻灯片和 Dashboard 里,它对指定名称、数字和信息层级的遵循都明显强于 low。也就是说,medium 买到的是“更少改稿”,而不只是“更高清”。

Gemini 3 Pro、Gemini 3.1 Flash 和 Seedream 5.0 Lite 都呈现出比较均衡的五边形。Gemini 3 Pro 更接近高完成度成稿,Gemini 3.1 Flash 胜在效率,Seedream Lite 则在中文、英文、UI 与信息图之间取得了意外不错的平衡。

Qwen-Image 3.0 Pro 和 Wan 2.7 Image 的总分接近,但侧重点不同:Qwen 3.0 Pro 更擅长 UI、科学图解与统一的设计系统;Wan 2.7 更擅长商业海报、复杂信息组织和“看起来像真实成品”的质感。

1. 精确文字:GPT medium、Gemini 3 Pro、Seedream Lite 更放心

音乐节门票是最残酷的一题:活动名、年份、日期、场地、主秀、5 个暖场艺人、开门时间和票号都必须准确。很多图第一眼很好看,放大后却会出现年份错误、艺人重复或小字乱码。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
12组模型的英文音乐节门票对比

GPT-Image-2 medium 基本完整保留了全部关键信息,版式也像可交付的收藏票。Gemini 3 Pro、Wan 2.7 和 Seedream Lite 同样完成度很高。Qwen 3.0 Pro 的主体信息大多可用,但标题年份出现偏差;GLM-Image 有艺人名重复和拼写问题。

GPT-Image-2 low 在这张样本里改写了日期、场地和艺人名单,说明 low 档即使能生成漂亮票面,也不适合把“逐字准确”当作默认能力。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
GPT-Image-2 medium 音乐节门票

中文与中英混排的差异更明显。咖啡海报里,多数新模型已经能写出“晨雾 / Morning Mist”,但 Gemini 2.5 Flash 在中文标题和品鉴文字上出现偏差。拉面海报中,它又把“豚骨拉麵”和英文副标题写错。就本轮样本看,它更适合低文字密度的视觉图,不建议直接输出多语言正式物料。

结论:严格文字场景优先 GPT-Image-2 medium、Gemini 3 Pro 或 Seedream 5.0 Lite;Wan 2.7、Qwen 3.0 Pro 和 Gemini 3.1 Flash 也很能打,但小字仍要复核。

2. 长指令:谁能理解,谁还能排得好看

电影分镜和发布会幻灯片同时考察数量、顺序、内容、镜头语言、文字和统一视觉系统。能把元素都“塞进去”只是第一步,真正可用还要求排版有主次。

GPT-Image-2 medium 的 6 格分镜和 4 页发布会幻灯片最接近一次完成:每格内容、镜头说明、产品规格和三档价格都能对上。Gemini 3 Pro 与 Gemini 3.1 Flash 紧随其后,画面叙事和说明文字都比较稳。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
Gemini 3 Pro 产品发布会幻灯片

Seedream 5.0 Lite 也是惊喜。它能把 6 格分镜、镜头说明和人物连续性同时保住,发布会 4 个区块也清晰可读。相较之下,Seedream 5.0 Pro 更强调视觉氛围,会主动改写或缩小部分说明文字。

Qwen 3.0 Pro 的发布会幻灯片很好,但分镜下方的小字号 camera note 出现乱码。Qwen 2.0 Pro 能理解 4 页结构,却把内容压成很小的画面,信息存在但不够可用;Wan 2.7 也在这一题出现类似的留白过大问题。

结论:长 Prompt 不只看“有没有漏”,还要看信息是否被组织成可读的设计。在本轮两道长指令样本中,GPT medium 和 Gemini 3 系列最稳,Seedream Lite 紧随其后。

3. UI 与 Dashboard:最容易暴露“看着像,但数据不对”

UI 生图经常能在缩略图里以假乱真,但只要检查状态栏、指标数字、表格列名和标签,就能看出模型是真理解还是只学会了界面纹理。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
12组模型的电商Dashboard对比

GPT-Image-2 medium、Qwen 3.0 Pro、Wan 2.7、Gemini 3.1 Flash、Gemini 3 Pro 和 Seedream Lite 都交出了结构完整的 Dashboard。其中 Wan 2.7 的信息密度和商业成品感尤其突出,指定的 Revenue、Orders、Customers、Conversion 四项数字也都保住了。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
Wan 2.7 电商后台 Dashboard

Qwen 2.0 Pro 是本轮 UI 场景里比较明显的失误:主指标还在,但大量小字发虚,表格难以阅读。GLM-Image 的界面框架成立,却会重复指标、改写栏目;Gemini 2.5 Flash 的结构不错,但细节清晰度和精确文字不如 3 系列。

Seedream 5.0 Pro 的视觉稿很干净,但部分样本仍带“AI生成”标记,正式交付前要确认水印策略。Seedream Lite 没有一味追求展示感,反而在数字、标签和完整导航上更可靠。

结论:产品原型与内部汇报,GPT medium、Gemini 3 系列、Qwen 3.0 Pro、Wan 2.7 和 Seedream Lite 都可优先试;需要逐字逐数还原时,仍要人工检查。

4. 多人物与科学图解:一个考数量,一个考关系

“正好 10 人”的办公室群像看似简单,实际上同时考人数、人物自然度、手部、人脸、空间透视和背景细节。多数模型都能生成自然办公室,却很难严格停在 10 人;人数越多,背景人脸越容易失真。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
12组模型的10人办公室群像对比

GPT-Image-2 medium 的人数控制和人物自然度比 low 有明显改善。Gemini 2.5 Flash 与 GLM-Image 的单张样本在人脸和真实摄影感上不错,但不代表它们在文字和 UI 场景也同样稳定。Qwen 2.0 Pro、Wan 2.7 和 Gemini 3.1 Flash 的画面里人数偏多,说明模型更容易满足“热闹办公室”,不容易满足“正好 10 人”。

水循环图解则是另一类复杂语义:Evaporation、Condensation、Precipitation、Runoff、Infiltration、Transpiration 不仅要写对,还要放在正确位置并用箭头串起关系。Qwen 3.0 Pro、GPT medium、Wan 2.7 和 Gemini 3 Pro 的结构最完整;Seedream Lite 的标签准确,但图解更简化;GLM-Image 出现标签缺失或位置关系不够清楚。

结论:多人图要多采样并人工数人;科学图解要同时检查文字和箭头逻辑,不能只看画面漂亮。

5. 条漫、美食与商业海报:审美和准确度终于能兼得

夜景条漫里,Qwen 3.0 Pro、GPT medium、Gemini 3 系列的角色连续性、四格节奏和对话文字都很稳。Seedream 5.0 Lite 的人物和氛围不错,但主动加入了 “PANEL 1/2/3/4” 标签,说明它会把结构要求显性化,不一定符合最终版式。

美食海报是 Seedream 5.0 Pro 的主场。它的拉面材质、蒸汽、暖光和竖版商业构图都很抓眼,属于第一眼就能吸引人的图;但精确小字仍需要复核。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
Seedream 5.0 Pro 拉面海报
引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
Gemini 2.5 Flash 拉面海报:画面不错但文字错误

运动鞋促销海报已经是大多数模型的强项。GPT medium、Qwen 3.0 Pro、Wan 2.7、Gemini 3 系列都能同时保留 “FLASH SALE、40% OFF、was 89.99、FREE SHIPPING、BUY NOW”。GLM-Image 的信息也很完整,商业冲击力不错。Seedream Lite 在这题里把旧价格附近写出了多余符号,说明它并不是每个文字场景都稳。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
Gemini 3.1 Flash 运动鞋促销海报

结论:要成品感,Seedream Pro、Wan 2.7 和 Gemini 3 系列都值得优先试;要同时保证价格与按钮文案,GPT medium 仍最省心。

模型画像:12 组配置分别适合什么

OpenAI

GPT-Image-2 low

  • 强项:除内测成本为 0 的 Qwen 3.0 Pro 外,它是本轮 usage 已返回成本的付费配置中最低的一组;速度也比 medium 快,普通商品图和低风险试稿够用。
  • 短板:复杂文字、专辑封面和多页幻灯片会改写关键信息。
  • 适合:批量探索构图、内部草稿、后续还会人工重做文字的任务。

GPT-Image-2 medium

  • 强项:本轮最强的指令遵循和文字能力,UI、票据、信息图、商业海报都稳定。
  • 短板:平均耗时约为 low 的两倍,接口返回成本约为 low 的 8.7 倍。
  • 适合:需要少改稿的正式物料、精确文字、产品原型和复杂设计任务。

阿里

Qwen-Image 3.0 Pro

  • 强项:UI、科学图解、商品海报和整体设计系统很稳,当前内测阶段本轮成本为 0。
  • 短板:平均耗时 101.1 秒,复杂分镜的小字容易乱码。
  • 适合:信息型设计、产品概念图、UI 方案探索;正式价格上线前重点试用。

Qwen-Image 2.0 Pro

  • 强项:主体文字通常可读,分镜和美食海报完成度不错。
  • 短板:Dashboard 发虚,发布会幻灯片信息过小;平均速度快但尾部延迟很高。
  • 适合:文字量中等的海报与分镜草图,不建议直接承担密集 UI。

Qwen-Image 2.0

  • 强项:平均速度快,咖啡、拉面、运动鞋等常规商业图完成度高。
  • 短板:技术爆炸图会把头戴式耳机理解成耳塞,复杂表格文字不稳。
  • 适合:常规电商海报、风格探索和低文字密度物料。

Wan 2.7 Image

  • 强项:Dashboard、科学图解、促销海报和精确文字都很强,平均 26.9 秒。
  • 短板:发布会幻灯片构图过小,多人图容易超出指定人数;成本未由 usage 返回。
  • 适合:商业设计、信息图、电商视觉和高信息密度画面。

Google

Gemini 3.1 Flash Image Preview

  • 强项:平均 13.4 秒,文字、UI、分镜、海报表现均衡,是本轮效率最突出的配置。
  • 短板:音乐节门票出现标题年份重复,多人数量控制不够严格;接口返回成本约 ¥0.672/张。
  • 适合:高频迭代、快速提案、既要速度又要较高完成度的业务。

Gemini 3 Pro Image Preview

  • 强项:画面、文字、复杂语义几乎没有明显短板;速度区间 20.2—26.9 秒,很稳定。
  • 短板:接口返回平均成本约 ¥1.187/张,是本轮 usage 已返回成本的配置中最高的一组。
  • 适合:预算允许、希望一次得到高完成度成稿的商业任务。

Gemini 2.5 Flash Image

  • 强项:速度快,极简海报、运动鞋海报和多人摄影样本都不错。
  • 短板:中文与中英混排错误明显,技术图和长文字任务不如 3 系列。
  • 适合:低文字密度视觉、概念图和快速构图,不适合直接生成多语言正式物料。

智谱

GLM-Image

  • 强项:美食、促销海报和人物摄影有不错的成品感,13 个任务全部完成。
  • 短板:技术爆炸图对象理解偏差,UI 数字与栏目会被改写,复杂图解关系不够稳。
  • 适合:通用视觉草稿、商品图与中文场景探索;信息准确型任务要加强复核。

豆包

Seedream 5.0 Pro

  • 强项:摄影感、材质、光影和竖版海报构图,是本轮视觉冲击力最突出的一组。
  • 短板:精确文字和数字不如第一梯队,部分样本带“AI生成”标记,平均耗时较长。
  • 适合:商品主视觉、氛围图、海报方向稿和需要“第一眼好看”的任务。

Seedream 5.0 Lite

  • 强项:比 Pro 更快、更便宜,本轮在文字、分镜、UI 和技术图上反而更稳定。
  • 短板:会主动增加结构标签,运动鞋海报的一处价格排版出现多余符号。
  • 适合:日常商业设计、信息图、UI 草图和批量方案探索,是豆包系更均衡的选择。

细分场景得分

模型较多,完整逐题分数拆成两张图。每格只对应一张样本,5 分表示接近直接可用,4 分表示主要任务完成但有小瑕疵,3 分表示存在明显错漏。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
OpenAI与阿里系细分场景得分
引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:12 组主流模型横向对比:GPT-Image-2 medium严谨最可控,Gemini 3.1 Flash高效最全能
Google、智谱与豆包细分场景得分

这些分数的意义不是排出一个“永远最强”的模型,而是帮助你按任务做选择。精确文字和复杂 UI 看 GPT medium、Gemini 3 Pro、Gemini 3.1 Flash、Seedream Lite;视觉冲击力看 Seedream Pro、Wan 2.7;追求速度看 Gemini 3.1 Flash、Gemini 2.5 Flash;低成本试稿可以看 GPT low,Qwen 3.0 Pro 则要结合内测资格与后续正式价格判断。

我的推荐

如果只能选一个通用配置,我会选 GPT-Image-2 medium。它不是最快也不是最便宜,但在真实业务最麻烦的几类任务——精确文字、数字、UI、长 Prompt——本轮样本中的明显返工项最少。

如果更看重速度与综合完成度,Gemini 3.1 Flash Image Preview 是本轮最值得关注的高效选项;预算更充足、追求一次成稿,可以看 Gemini 3 Pro Image Preview

如果要做电商海报、信息图和高密度商业设计,Wan 2.7 Image 很有竞争力。已经有 Qwen 3.0 Pro 内测权限的话,也值得继续用在 UI 和信息型画面上,但要接受更长耗时,并等待正式价格。

如果偏好豆包的审美,日常通用任务优先试 Seedream 5.0 Lite,需要更强摄影感、材质和海报冲击力时再切到 Seedream 5.0 Pro

最后仍要提醒:这是一轮单样本横向观察。正式选型前,最好拿自己的真实 Prompt 连续跑多次,并把“文字复核、多人计数、价格与数字检查、水印策略”写进交付流程。



非线智能API可连接超480+全球模型,支持一键Api聚合以及Api中转,提供稳定的企业级服务。 登录github账号,领20-50元体验金。

非线智能api 图 8