数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

github (非线智能)官网

正文:

这轮看图看到一半,我先改掉了一个习惯:不能先看哪张更漂亮。

最典型的是“10人办公室”这道题。Nano Banana 2 生成的办公室很像真的,砖墙、绿植、玻璃会议室、前后景都有,人物也自然。乍看几乎就是高分答案。可 Prompt 里写的是 exactly 10 people。我把图放大,顺着桌子一圈一圈数,最后数到14个人。

这张图不能因为漂亮就拿高分。它做对了很多事,偏偏把题目里最硬的一条做错了。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:把18款生图模型的234张图摊开看了一遍:GPT与Nano Banana Pro领跑,国产Wan2.7表现最稳
同一条“10人办公室”Prompt下的结果对比

图中第4张是 Nano Banana 2。办公室氛围和人物自然度都很好,但人数超出了题目要求。

所以这次我没有再找一个模型来当裁判。18款模型做同一道题的结果被放到一起,先查文字、数字、人数、分镜数和空间关系,再看构图、质感和最后能不能直接用。13道题一共234张图,全部这样看完。

分数仍然是1到5分,但它表示的是“这道题完成了多少”,不是“我有多喜欢这张图”。

先看结果

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:把18款生图模型的234张图摊开看了一遍:GPT与Nano Banana Pro领跑,国产Wan2.7表现最稳
18款生图模型综合结果

换算成百分制以后,gpt-image-2(medium)拿到99.2分,Nano Banana pro 是98.5分。13道题、每题只有一张样本,这0.7分撑不起“谁碾压谁”之类的结论。更准确的说法是:这两款模型在本轮里几乎没有明显短板。长文字、四页 Keynote、指定价格的促销海报、带六个术语和两个温度的水循环图,它们都能接住。

Nano Banana 2 得到93.8分。它在 Keynote、Dashboard、水循环、条漫、拉面和促销海报里都很强,办公室那张却一下暴露了问题:它理解了“现代办公室”,也理解了“大家在协作”,没守住“只能有10个人”。图越好看,这种错越容易被放过去。

紧接着是 wan2.7-image-pro,91.5分。它的13张图没有一张低于4分。它未必每道题都最精致,但很少把整道题做坏。wan2.6-t2i 和 wan2.5-t2i-preview 分别是88.5和87.7分,和2.2、2.1那批模型放在一起看,代际差别很明显。

千问这组还有一个挺实用的提醒:qwen-image-plus 得到86.2分,qwen-image-max 是83.8分。名字里的 max、plus 不能替人选模型。放到自己的任务里跑一次,往往比猜产品命名更有用。

综合表中的平均耗时统一按13道题的端到端时间计算,包含接口排队、下载和重试。平均花费则使用后台账单或API返回的人民币成本,除以实际调用次数。

百分制分数是怎么算出来的

这轮没有再做分项榜。现在每款模型每道题只有一张图,把小样本继续切碎,很容易把偶然结果写得像稳定能力。

每道题仍按整体完成度打1到5分,允许0.5分。13道题的原始分相加后,再统一换算成百分制。这样保留了逐题评分的直观性,最终结果也更容易阅读。

百分制总分 = 13道题的原始得分之和 ÷ 65 × 100

打每一题时,我会同时看指令有没有跟完、画面是否完整、主体关系对不对、指定文字能不能读、结果是否接近可交付。但这些没有被拆成五个独立分数。比如一张海报中文写错了,扣的是这道题的完成度,不会再造一个看似精确的“文字能力指数”。

13道题分布在六类任务里:

任务维度题数在总分中的权重
文字渲染323.08%
长指令215.38%
UI生成215.38%
多主体与复杂语义215.38%
图文混合215.38%
艺术海报215.38%

文字渲染多一题,所以权重略高。这个权重不是先拍出来的,它只是题目数量在总分里的自然占比。以后数据扩充,权重也应跟着题集重新审视。

5分意味着核心要求基本全部完成,已经接近可以直接交付;4分是核心要求完成,还有少量错字、细节或排版问题;3分能看出题目目标,但有明显漏项、错字、数量或结构错误;2分只做对一部分;1分则是严重偏题或基本不可用。

模型会写字以后,事情变得不太一样了

过去看生图,文字经常被当成一种纹理。现在头部模型已经能把一长串指定内容放进票券、菜单和商业海报,测试方式也得跟着变。不能只问“有没有字”,要逐个核对它写的是不是那几个字。

双语咖啡海报要求中文标题“晨雾”。Nano Banana 的版式和咖啡摄影都像成品,标题却明显不对;Nano Banana pro 和 qwen-image-plus 把中英文信息保留得更完整。到了拉面海报,题目同时要求“豚骨拉麵”“Tonkotsu Ramen”和“濃厚白湯”,Nano Banana 又在中文上失分。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:把18款生图模型的234张图摊开看了一遍:GPT与Nano Banana Pro领跑,国产Wan2.7表现最稳
中英双语咖啡海报对比
引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:把18款生图模型的234张图摊开看了一遍:GPT与Nano Banana Pro领跑,国产Wan2.7表现最稳
拉面海报的文字与画面组合

这也是总分不该代替场景判断的地方。Nano Banana 的52.5分不算低,做普通界面和极简封面也不差。如果工作刚好是中文包装、菜单或餐饮海报,那两次文字失败比它排在第几更值得记住。

文字题还会暴露另一类问题:有的模型能把字写对,却放不下完整信息;有的会保住大标题,把小字、票号或艺人名单改掉;还有的画出一张很像票的东西,票面内容却已经不是题目给的内容。视觉上像,和真的完成,是两回事。

Prompt 变长,模型最先丢掉什么

产品发布会那道题要求一张图里放四页 Keynote:芯片、屏幕、续航、价格各一页,还给了 M4 Ultra、12.9 OLED、22h,以及 1499、$1899 三档价格。这里任何一项漏掉,画面依然可能很像发布会,信息却不能用了。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:把18款生图模型的234张图摊开看了一遍:GPT与Nano Banana Pro领跑,国产Wan2.7表现最稳
四页产品发布会Keynote对比

gpt-image-2(medium)、Nano Banana pro 和 Nano Banana 2 在这道题里都拿到5分。较老的 Wan 模型经常没守住四页结构,或者把规格和价格改掉。它们不是完全没听懂 Prompt,而是在长指令里先保住了题材和风格,把不那么显眼的硬约束放掉了。

另一道电影分镜题要求六格、固定镜头顺序、角色连续,还带机位说明。这类题比“画一个电影感场景”难得多。后者只要气氛对,前者要让六个格子共同完成同一件事。头部模型现在已经能做到,但不能只缩小看整页,得逐格查。

像个界面,不等于这个界面能用

UI题最会制造“第一眼不错”。健身 App 那道题给了9:41、问候语、72%圆环、三张数据卡、训练计划和底部导航。少一项,手机截图还是手机截图。

gpt-image-2(medium)和 wan2.7-image-pro 在这题里都拿到5分。z-image-turbo 只有2.5分,它把页面做成了几块悬浮卡片,更像设计灵感板,不像一张真实 App 截图。

电商 Dashboard 还要再难一点。Revenue 128,430、Orders 2,847、Customers 18,204、Conversion 4.8%,四个数必须分别留在正确的指标卡里,旁边还要有侧栏、搜索、折线图、订单表和状态标签。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:把18款生图模型的234张图摊开看了一遍:GPT与Nano Banana Pro领跑,国产Wan2.7表现最稳
电商后台Dashboard对比

这道题里,gpt-image-2(medium)、Nano Banana pro、Nano Banana 2 和 wan2.7-image-pro 都拿到5分。低分结果的问题通常不是“不够漂亮”,而是把桌面后台画成移动端、把数字改掉,或者只留下几张彼此没有关系的数据卡。

人数、箭头和前后关系,仍然要靠人去查

办公室题只需要数到10,已经让 Nano Banana 2 丢了两分。水循环图更麻烦:Evaporation、Condensation、Precipitation、Runoff、Infiltration、Transpiration 六个术语要放对,Ocean 25°C 和 Land 18°C 要保留,箭头还得符合水循环关系。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:把18款生图模型的234张图摊开看了一遍:GPT与Nano Banana Pro领跑,国产Wan2.7表现最稳
水循环科学图解:OpenAI、Nano Banana与Qwen
引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:把18款生图模型的234张图摊开看了一遍:GPT与Nano Banana Pro领跑,国产Wan2.7表现最稳
水循环科学图解:Wan各代模型

gpt-image-2(medium)、Nano Banana pro、Nano Banana 2、wan2.7-image-pro 和 wan2.6-t2i 完整度最高。到了 Wan 2.2,画面仍然像一张科普图,词开始拼错,箭头也乱。再往前,有时只剩山、水、云这些视觉元素,已经不能拿去教学生。

这类图让我越来越不愿意用“语义理解不错”这种宽泛判断。词有没有写对,箭头从哪里指到哪里,办公室里到底有几个人,都可以直接查。能查的地方,就别让印象代替检查。

有些模型不是弱,而是忽高忽低

z-image-turbo 很典型。它在夜景条漫、拉面、极简专辑封面和运动鞋促销海报里都拿到5分,到了健身 UI 却只有2.5分。百分制总分会把这种波动压成一个看起来很平顺的82.3分,实际使用时,知道它在哪类任务上容易突然失手,可能更重要。

minimax-image-01-live 和 wanx-v1 在当前这套纯文生图调用里频繁偏题,有的结果和 Prompt 只剩颜色或题材上的一点联系。这里能说的是“当前调用方式下不好用”,不能顺手扩大成“模型在所有用途里都差”。特别是带 live 的模型,它可能更偏实时交互、参考图或另一套工作流。只截一张失败图,再给整个模型定性,结论会跑得比证据快。

速度和成本,也放到一起看

表里的时间从提交请求算到图片拿回本地,包含接口排队、轮询、下载和重试,不等于模型在厂商服务器里的纯推理时间。每款模型都跑同样的13道题,再取端到端算术平均值。

这次结果里,z-image-turbo 平均5.8秒,qwen-image-plus 11.3秒,wan2.2-t2i-flash 15.1秒,Nano Banana 2 是16.2秒。另一头,gpt-image-2(medium)平均60.5秒,wan2.7-image-pro 50.1秒,minimax-image-01 45.0秒,wanx-v1 43.9秒。快慢差距很大,但它同时混入了模型、服务商和当时网络状态,适合解释这次调用体验,不适合当成永久速度榜。

花费按“后台或API返回的人民币总花费 ÷ 实际调用次数”计算,失败后的重试也算一次调用。这里算的是平均每次API调用花费,不是每道题的预算上限。

几项差异比较明显:minimax-image-01 和 minimax-image-01-live 都是每次0.025元,wan2.2-t2i-flash 和 wanx2.1-t2i-turbo 都是0.140元;gpt-image-2(medium)是0.374元,Nano Banana 0.280元,Nano Banana 2 为0.647元,Nano Banana pro 则是1.148元。所有金额都来自本轮实际调用记录或后台账单,不是拿官网标价估算。

这次到底用了什么图片参数

参数表只写本轮真实提交的值,不把“这次用了什么”扩写成“模型只支持什么”。不同平台、版本和调用方式可能还有别的尺寸与出图数量,具体支持范围应以接入平台当时的文档为准。

所有模型每道题都只生成1张,所以这轮没有资格讨论多次出图稳定性。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】生图模型实测:把18款生图模型的234张图摊开看了一遍:GPT与Nano Banana Pro领跑,国产Wan2.7表现最稳

最后

如果只看这13道题,gpt-image-2(medium)和 Nano Banana pro 最稳,Nano Banana 2 的上限很高,但精确数量约束仍会突然失手;wan2.7-image-pro 是这轮最稳定的国产商用模型,Wan几代之间的进步也能直接从图里看见。

再往下,我不太想急着写“哪个场景该选谁”。每款模型每题只有一张图,分项榜和场景推荐都会把偶然性放大。下一轮更值得做的是增加题目,也给同一 Prompt 做多次采样。等每类任务有了足够样本,才谈得上稳定性、分项能力和场景推荐。

目前这轮至少把一件事说清楚了:生图模型已经不只是比谁画得漂亮。现在真正拉开差距的,常常是图里那个不显眼的数字、少掉的一格、写错的两个汉字,或者本来只能出现10个人的办公室里,多坐了4个人。



非线智能官网https://nonelinear.com 已上线gpt-image-2、Nano Banana 2、Wan 系列在内生图模型 ,支持一键接入,同时,非线智能API可连接超480+全球模型,支持一键Api聚合以及Api中转,提供稳定的企业级服务。 登录github账号,领20-50元体验金。接入生图模型就用非线智能API。