正文:
这 12 组里包含同一个 gpt-image-2 的 low、medium 两档,因此严格来说是 11 个模型、12 组配置。这样安排也正好能回答一个实用问题:同一个模型提高质量档位,究竟值不值。
参与的完整模型 ID 包括:OpenAI 的 gpt-image-2(low、medium);阿里的 qwen-image-3.0-pro、qwen-image-2.0-pro、qwen-image-2.0、wan2.7-image;Google 的 gemini-3.1-flash-image-preview、gemini-3-pro-image-preview、gemini-2.5-flash-image;智谱的 glm-image;以及豆包的 doubao-seedream-5-0-pro-260628、Doubao-Seedream-5.0-lite。
一句话结论
- GPT-Image-2 medium 最可控:精确文字、长指令、UI 和商业物料都很稳;low 更适合低成本试稿,但本轮漏项和改写更多。
- Gemini 3 Pro 最均衡:本轮画质、文字、复杂语义都接近第一梯队,速度还很稳定,但在 usage 已返回成本的配置中平均成本最高。
- Gemini 3.1 Flash 最像“高效全能型”:平均 13.4 秒,文字、UI、分镜和海报没有明显短板。
- Seedream 5.0 Lite 是本轮惊喜:比 Pro 更快、更便宜,精确文字和结构化任务反而更稳;Pro 仍胜在摄影感和视觉冲击力。
- Wan 2.7 和 Qwen-Image 3.0 Pro 各有优势:Wan 的商业设计与信息图很强;Qwen 3.0 Pro 的 UI、图解和整体完成度高,但平均耗时最慢。
评测方法
本期每组配置都跑同一批 13 个文生图任务,覆盖:
- 文字渲染:英文音乐节门票、中英咖啡海报、耳机爆炸图
- 长指令:6 格电影分镜、4 页产品发布会幻灯片
- UI 生成:iOS 健身 App、电商后台 Dashboard
- 多主体与信息图:10 人办公室群像、水循环科学图解
- 图文混合:夜景城市条漫、美食摄影文字叠加
- 商业设计:极简专辑封面、运动鞋促销海报
评分看 5 个维度,每项满分 5 分:
- 指令遵循:主体、风格、构图和指定元素是否到位。
- 画面质量:清晰度、光影、细节、构图和整体审美。
- 复杂语义:数量、空间关系、信息层级和多约束是否正确。
- 文字能力:中英文、数字、标签、价格与 UI 文案是否准确可读。
- 稳定性:这里实际衡量最终输出完整性,即是否拿到可评分图片、是否严重偏题或尺寸异常;网络、网关、限流等调用重试不计入模型得分。
各模型按接口支持的常用档位生成:多数约为 1K,Seedream Lite 使用接口最低支持的 2K,GLM-Image 为 1280×1280,另有少数模型采用接口默认规格。成本只反映本轮实际请求规格,不等同于同分辨率的官方价格横比。
主观评分时,每组配置的每个用例只取 1 张样本;耗时与成本按同配置的 13 次成功调用统计。因此分数更适合观察能力侧重点,不建议把它当作长期稳定结论。
客观数据:速度差距比想象中更大

本轮纳入对比的 12 组配置最终都获得了 13 张可评分结果,因此在最终完成数上没有拉开差距;这不等同于一次调用成功率。真正拉开差距的是速度、成本和结果可用性。
速度最快的一组是 Gemini 3.1 Flash,平均 13.4 秒;Gemini 2.5 Flash 为 14.7 秒,Qwen-Image 2.0 为 17.8 秒。需要注意的是,Qwen 2.0 和 Qwen 2.0 Pro 虽然平均值很好看,最慢单张分别达到 141.6 秒和 148.0 秒,波动明显。Gemini 3 Pro 的平均耗时是 23.1 秒,最快 20.2 秒、最慢 26.9 秒,反而是本轮最稳定的速度曲线之一。
GPT-Image-2 从 low 提升到 medium 后,平均耗时从 32.2 秒增加到 63.2 秒,接口返回的平均成本从约人民币 ¥0.046 增加到 ¥0.403。也就是耗时接近翻倍,成本约为 8.7 倍;换来的则是精确文字、长指令和 UI 完成度的明显提升。
豆包内部的差异也很直观:Seedream 5.0 Lite 平均 51.4 秒、约 ¥0.22/张;Seedream 5.0 Pro 平均 91.5 秒、约 ¥0.30/张。Lite 不只是便宜和快,本轮在结构化任务里也更听话。
成本表里“未返回”不等于免费,只表示接口 usage 没有给出可直接采用的成本。本轮 qwen-image-3.0-pro 仍处于内测阶段,测试成本为 0,正式价格要以平台上线规则为准。
能力评分:高质量不只等于“更清晰”

这张表最值得看的不是合计,而是不同模型在哪一列掉分。
GPT-Image-2 medium 的提升不只是纹理更细。音乐节门票、发布会幻灯片和 Dashboard 里,它对指定名称、数字和信息层级的遵循都明显强于 low。也就是说,medium 买到的是“更少改稿”,而不只是“更高清”。
Gemini 3 Pro、Gemini 3.1 Flash 和 Seedream 5.0 Lite 都呈现出比较均衡的五边形。Gemini 3 Pro 更接近高完成度成稿,Gemini 3.1 Flash 胜在效率,Seedream Lite 则在中文、英文、UI 与信息图之间取得了意外不错的平衡。
Qwen-Image 3.0 Pro 和 Wan 2.7 Image 的总分接近,但侧重点不同:Qwen 3.0 Pro 更擅长 UI、科学图解与统一的设计系统;Wan 2.7 更擅长商业海报、复杂信息组织和“看起来像真实成品”的质感。
1. 精确文字:GPT medium、Gemini 3 Pro、Seedream Lite 更放心
音乐节门票是最残酷的一题:活动名、年份、日期、场地、主秀、5 个暖场艺人、开门时间和票号都必须准确。很多图第一眼很好看,放大后却会出现年份错误、艺人重复或小字乱码。

GPT-Image-2 medium 基本完整保留了全部关键信息,版式也像可交付的收藏票。Gemini 3 Pro、Wan 2.7 和 Seedream Lite 同样完成度很高。Qwen 3.0 Pro 的主体信息大多可用,但标题年份出现偏差;GLM-Image 有艺人名重复和拼写问题。
GPT-Image-2 low 在这张样本里改写了日期、场地和艺人名单,说明 low 档即使能生成漂亮票面,也不适合把“逐字准确”当作默认能力。

中文与中英混排的差异更明显。咖啡海报里,多数新模型已经能写出“晨雾 / Morning Mist”,但 Gemini 2.5 Flash 在中文标题和品鉴文字上出现偏差。拉面海报中,它又把“豚骨拉麵”和英文副标题写错。就本轮样本看,它更适合低文字密度的视觉图,不建议直接输出多语言正式物料。
结论:严格文字场景优先 GPT-Image-2 medium、Gemini 3 Pro 或 Seedream 5.0 Lite;Wan 2.7、Qwen 3.0 Pro 和 Gemini 3.1 Flash 也很能打,但小字仍要复核。
2. 长指令:谁能理解,谁还能排得好看
电影分镜和发布会幻灯片同时考察数量、顺序、内容、镜头语言、文字和统一视觉系统。能把元素都“塞进去”只是第一步,真正可用还要求排版有主次。
GPT-Image-2 medium 的 6 格分镜和 4 页发布会幻灯片最接近一次完成:每格内容、镜头说明、产品规格和三档价格都能对上。Gemini 3 Pro 与 Gemini 3.1 Flash 紧随其后,画面叙事和说明文字都比较稳。

Seedream 5.0 Lite 也是惊喜。它能把 6 格分镜、镜头说明和人物连续性同时保住,发布会 4 个区块也清晰可读。相较之下,Seedream 5.0 Pro 更强调视觉氛围,会主动改写或缩小部分说明文字。
Qwen 3.0 Pro 的发布会幻灯片很好,但分镜下方的小字号 camera note 出现乱码。Qwen 2.0 Pro 能理解 4 页结构,却把内容压成很小的画面,信息存在但不够可用;Wan 2.7 也在这一题出现类似的留白过大问题。
结论:长 Prompt 不只看“有没有漏”,还要看信息是否被组织成可读的设计。在本轮两道长指令样本中,GPT medium 和 Gemini 3 系列最稳,Seedream Lite 紧随其后。
3. UI 与 Dashboard:最容易暴露“看着像,但数据不对”
UI 生图经常能在缩略图里以假乱真,但只要检查状态栏、指标数字、表格列名和标签,就能看出模型是真理解还是只学会了界面纹理。

GPT-Image-2 medium、Qwen 3.0 Pro、Wan 2.7、Gemini 3.1 Flash、Gemini 3 Pro 和 Seedream Lite 都交出了结构完整的 Dashboard。其中 Wan 2.7 的信息密度和商业成品感尤其突出,指定的 Revenue、Orders、Customers、Conversion 四项数字也都保住了。

Qwen 2.0 Pro 是本轮 UI 场景里比较明显的失误:主指标还在,但大量小字发虚,表格难以阅读。GLM-Image 的界面框架成立,却会重复指标、改写栏目;Gemini 2.5 Flash 的结构不错,但细节清晰度和精确文字不如 3 系列。
Seedream 5.0 Pro 的视觉稿很干净,但部分样本仍带“AI生成”标记,正式交付前要确认水印策略。Seedream Lite 没有一味追求展示感,反而在数字、标签和完整导航上更可靠。
结论:产品原型与内部汇报,GPT medium、Gemini 3 系列、Qwen 3.0 Pro、Wan 2.7 和 Seedream Lite 都可优先试;需要逐字逐数还原时,仍要人工检查。
4. 多人物与科学图解:一个考数量,一个考关系
“正好 10 人”的办公室群像看似简单,实际上同时考人数、人物自然度、手部、人脸、空间透视和背景细节。多数模型都能生成自然办公室,却很难严格停在 10 人;人数越多,背景人脸越容易失真。

GPT-Image-2 medium 的人数控制和人物自然度比 low 有明显改善。Gemini 2.5 Flash 与 GLM-Image 的单张样本在人脸和真实摄影感上不错,但不代表它们在文字和 UI 场景也同样稳定。Qwen 2.0 Pro、Wan 2.7 和 Gemini 3.1 Flash 的画面里人数偏多,说明模型更容易满足“热闹办公室”,不容易满足“正好 10 人”。
水循环图解则是另一类复杂语义:Evaporation、Condensation、Precipitation、Runoff、Infiltration、Transpiration 不仅要写对,还要放在正确位置并用箭头串起关系。Qwen 3.0 Pro、GPT medium、Wan 2.7 和 Gemini 3 Pro 的结构最完整;Seedream Lite 的标签准确,但图解更简化;GLM-Image 出现标签缺失或位置关系不够清楚。
结论:多人图要多采样并人工数人;科学图解要同时检查文字和箭头逻辑,不能只看画面漂亮。
5. 条漫、美食与商业海报:审美和准确度终于能兼得
夜景条漫里,Qwen 3.0 Pro、GPT medium、Gemini 3 系列的角色连续性、四格节奏和对话文字都很稳。Seedream 5.0 Lite 的人物和氛围不错,但主动加入了 “PANEL 1/2/3/4” 标签,说明它会把结构要求显性化,不一定符合最终版式。
美食海报是 Seedream 5.0 Pro 的主场。它的拉面材质、蒸汽、暖光和竖版商业构图都很抓眼,属于第一眼就能吸引人的图;但精确小字仍需要复核。


运动鞋促销海报已经是大多数模型的强项。GPT medium、Qwen 3.0 Pro、Wan 2.7、Gemini 3 系列都能同时保留 “FLASH SALE、40% OFF、was

结论:要成品感,Seedream Pro、Wan 2.7 和 Gemini 3 系列都值得优先试;要同时保证价格与按钮文案,GPT medium 仍最省心。
模型画像:12 组配置分别适合什么
OpenAI
GPT-Image-2 low
- 强项:除内测成本为 0 的 Qwen 3.0 Pro 外,它是本轮 usage 已返回成本的付费配置中最低的一组;速度也比 medium 快,普通商品图和低风险试稿够用。
- 短板:复杂文字、专辑封面和多页幻灯片会改写关键信息。
- 适合:批量探索构图、内部草稿、后续还会人工重做文字的任务。
GPT-Image-2 medium
- 强项:本轮最强的指令遵循和文字能力,UI、票据、信息图、商业海报都稳定。
- 短板:平均耗时约为 low 的两倍,接口返回成本约为 low 的 8.7 倍。
- 适合:需要少改稿的正式物料、精确文字、产品原型和复杂设计任务。
阿里
Qwen-Image 3.0 Pro
- 强项:UI、科学图解、商品海报和整体设计系统很稳,当前内测阶段本轮成本为 0。
- 短板:平均耗时 101.1 秒,复杂分镜的小字容易乱码。
- 适合:信息型设计、产品概念图、UI 方案探索;正式价格上线前重点试用。
Qwen-Image 2.0 Pro
- 强项:主体文字通常可读,分镜和美食海报完成度不错。
- 短板:Dashboard 发虚,发布会幻灯片信息过小;平均速度快但尾部延迟很高。
- 适合:文字量中等的海报与分镜草图,不建议直接承担密集 UI。
Qwen-Image 2.0
- 强项:平均速度快,咖啡、拉面、运动鞋等常规商业图完成度高。
- 短板:技术爆炸图会把头戴式耳机理解成耳塞,复杂表格文字不稳。
- 适合:常规电商海报、风格探索和低文字密度物料。
Wan 2.7 Image
- 强项:Dashboard、科学图解、促销海报和精确文字都很强,平均 26.9 秒。
- 短板:发布会幻灯片构图过小,多人图容易超出指定人数;成本未由 usage 返回。
- 适合:商业设计、信息图、电商视觉和高信息密度画面。
Gemini 3.1 Flash Image Preview
- 强项:平均 13.4 秒,文字、UI、分镜、海报表现均衡,是本轮效率最突出的配置。
- 短板:音乐节门票出现标题年份重复,多人数量控制不够严格;接口返回成本约 ¥0.672/张。
- 适合:高频迭代、快速提案、既要速度又要较高完成度的业务。
Gemini 3 Pro Image Preview
- 强项:画面、文字、复杂语义几乎没有明显短板;速度区间 20.2—26.9 秒,很稳定。
- 短板:接口返回平均成本约 ¥1.187/张,是本轮 usage 已返回成本的配置中最高的一组。
- 适合:预算允许、希望一次得到高完成度成稿的商业任务。
Gemini 2.5 Flash Image
- 强项:速度快,极简海报、运动鞋海报和多人摄影样本都不错。
- 短板:中文与中英混排错误明显,技术图和长文字任务不如 3 系列。
- 适合:低文字密度视觉、概念图和快速构图,不适合直接生成多语言正式物料。
智谱
GLM-Image
- 强项:美食、促销海报和人物摄影有不错的成品感,13 个任务全部完成。
- 短板:技术爆炸图对象理解偏差,UI 数字与栏目会被改写,复杂图解关系不够稳。
- 适合:通用视觉草稿、商品图与中文场景探索;信息准确型任务要加强复核。
豆包
Seedream 5.0 Pro
- 强项:摄影感、材质、光影和竖版海报构图,是本轮视觉冲击力最突出的一组。
- 短板:精确文字和数字不如第一梯队,部分样本带“AI生成”标记,平均耗时较长。
- 适合:商品主视觉、氛围图、海报方向稿和需要“第一眼好看”的任务。
Seedream 5.0 Lite
- 强项:比 Pro 更快、更便宜,本轮在文字、分镜、UI 和技术图上反而更稳定。
- 短板:会主动增加结构标签,运动鞋海报的一处价格排版出现多余符号。
- 适合:日常商业设计、信息图、UI 草图和批量方案探索,是豆包系更均衡的选择。
细分场景得分
模型较多,完整逐题分数拆成两张图。每格只对应一张样本,5 分表示接近直接可用,4 分表示主要任务完成但有小瑕疵,3 分表示存在明显错漏。


这些分数的意义不是排出一个“永远最强”的模型,而是帮助你按任务做选择。精确文字和复杂 UI 看 GPT medium、Gemini 3 Pro、Gemini 3.1 Flash、Seedream Lite;视觉冲击力看 Seedream Pro、Wan 2.7;追求速度看 Gemini 3.1 Flash、Gemini 2.5 Flash;低成本试稿可以看 GPT low,Qwen 3.0 Pro 则要结合内测资格与后续正式价格判断。
我的推荐
如果只能选一个通用配置,我会选 GPT-Image-2 medium。它不是最快也不是最便宜,但在真实业务最麻烦的几类任务——精确文字、数字、UI、长 Prompt——本轮样本中的明显返工项最少。
如果更看重速度与综合完成度,Gemini 3.1 Flash Image Preview 是本轮最值得关注的高效选项;预算更充足、追求一次成稿,可以看 Gemini 3 Pro Image Preview。
如果要做电商海报、信息图和高密度商业设计,Wan 2.7 Image 很有竞争力。已经有 Qwen 3.0 Pro 内测权限的话,也值得继续用在 UI 和信息型画面上,但要接受更长耗时,并等待正式价格。
如果偏好豆包的审美,日常通用任务优先试 Seedream 5.0 Lite,需要更强摄影感、材质和海报冲击力时再切到 Seedream 5.0 Pro。
最后仍要提醒:这是一轮单样本横向观察。正式选型前,最好拿自己的真实 Prompt 连续跑多次,并把“文字复核、多人计数、价格与数字检查、水印策略”写进交付流程。
非线智能API可连接超480+全球模型,支持一键Api聚合以及Api中转,提供稳定的企业级服务。 登录github账号,领20-50元体验金。
