本文大概

3756

读完共需

7

分钟

开发者都有这种纠结,在Codex、CC、Work Buddy这些工具中,到底应不应该给大模型点开思考模式,或者什么情况下才应该开启呢?

不开吧,怕智商、性能不够

开吧,怕智力性能过剩导致浪费

本文就ARC-RRIZE测试法帮你解决这个问题,收藏点赞不迷路

下文评测厂牌包含:

图片 1 / 4

---------

01.

标准介绍/;

ARC-评测方法

到底有多牛

ARC Prize由弗朗索瓦·肖莱于 2019 年提出,评估AI面对未知任务时的流体智力、抽象推理与泛化能力的测试。本文数据集取自arcprize.org

平时大家测大模型,无非是考历史、刷高考题、背代码库,那些模型早把互联网数据背得滚瓜烂熟,纯属“开卷作弊”。

但本次数据源ARC-AGI的测试方式不一样,它不靠死记硬背,纯几何因果智商测试

截止目前为止,没有任何一个模型能全部通关试题集,可见这套测试的含金量

图片图片

测试规则说明

1、测试逻辑:测试由2组试题集组成,即为ARC-1ARC-2。每次只给 2~3 张从没见过的彩色色块变换图,让AI现场顿悟背后的空间逻辑,然后自己把测试图画出来。

2、评价严肃:只要有一个像素网格颜色填错,整道题直接判0分(Pass@2两次机会)。

3、打分粗暴:答对率有多高?它到底烧了你多少美刀。



01

ARC-AGI-1 官方真题

测试问题集ARC-1

给出输入输出示例,AI需识别离散色块的几何连通性并做对称染色。这属于直觉感知与单层规则


02

测试问题集ARC-2

色块被赋予了“运算指令”和“动态阻挡”含义,存在多套联动规则。普通单步推理和模板搜索完全失效

ARC-AGI-2 官方真题

02.

厂牌实测结果/;

ARC-AGI

评测结果

核心主流模型ARC测试后,散点图清晰反映了当下的产业现状:

智商可以用钱(算力时间)买,但存在明显的边际效用递减!

引自非线智能(GitHub 第一 AI 商业测评) - 非线智能评测 | 开“思考模式”消耗多10倍,性能只涨1%?

思考无思考模式差别对不同模型有不同的影响,下面展开说明

Claude (Anthropic) 模型测试

模型档位综合均分
(ARC-1/ARC-2)
性能提升单题费用
Claude
Opus 5
高思考92.9%
97.5%/88.3%
100%
(基准)
$0.470
(基准)
极限93.95%
97.5%/90.4%
101.1%
(+1.1%)
$0.700
(+48.9%)
Claude
Fable 5
低思考83.65%
90.5%/76.8%
100%
(基准)
$0.508
(基准)
中思考87.5%
92.5%/82.5%
104.6%
(+4.6%)
$0.664
(+30.7%)
高思考91.5%
95.5%/87.5%
109.4%
(+9.4%)
$0.767
(+51.0%)
极限93.85%
98.5%/89.2%
112.2%
(+12.2%)
$2.110
(+316%)
Claude
Opus 4.8
低思考75.1%
88.0%/62.2%
100%
(基准)
$0.671
(基准)
中思考81.6%
91.5%/71.7%
108.7%
(+8.7%)
$0.912
(+35.8%)
高思考82.05%
92.0%/72.1%
109.3%
(+9.3%)
$1.042
(+55.2%)
Sonnet
4.5 / 4.6
高/Max73.45%
86.5%/60.4%
100%
(单档基准)
$1.19~$2.72
Claude 思考模式建议

1、Opus 5 基线即天花板:高思考均分达 92.9%,拉满 Max 仅微涨 +1.05%,费用却暴涨 49% 至 $0.70,开高思考即可,无需开 Max。

2、Opus 4.8 存在溢价陷阱:从中思考切到高思考仅涨 +0.45%,费用却破 $1.04;需高智商建议直接上 Opus 5(更强且更便宜)。

3、Fable 5 是高智商甜点:中/高思考均分达 87%~91%(单题 $0.66~$0.76),但极限档单题飙至 $2.11,不建议开极限。

4、选型建议:核心攻坚首选 Opus 5(高思考) 或 Fable 5(中/高思考),坚决避开 Opus 4.8 高思考。

OpenAI GPT-5.6 系列测试
模型档位综合均分
(ARC-1/ARC-2)
性能提升单题费用
GPT-5.6
Sol (旗舰)
低思考58.5%
74.5%/42.5%
100%
(基准)
$0.170
(基准)
中思考79.8%
92.5%/67.1%
136.4%
(+36.4%)
$0.220
(+29.4%)
高/极限95.0%
97.5%/92.5%
162.4%
(+62.4%)
+76%~218%
GPT-5.6
Terra (主力)
低思考39.5%
60.2%/18.8%
100%
(基准)
$0.090
(基准)
中思考57.25%
77.0%/37.5%
144.9%
(+44.9%)
$0.130
(+44.4%)
高/极限90.2%
96.5%/83.9%
228.4%
(+128%)
+111%~511%
GPT-5.6
Luna (极速)
无思考2.05%
3.3%/0.8%
100%
(基准)
$0.0047
(基准)
低思考21.55%
39.5%/3.6%
10.51x
(+951%)
$0.0082
(+76.2%)
中思考30.7%
54.0%/7.4%
14.98x
(+1398%)
$0.0120
(+158%)
高/极限75.15%
90.7%/59.6%
36.66x
(+3566%)
+499%~1303%
OpenAI GPT-5.6 思考模式建议

1、Sol 统治极限智商:高/极限档均分飙至 95.0%(ARC-2 攻下全场第一的 92.5%),是全场算力正反馈最强的旗舰。

2、Terra 展现中档爆发力:中思考 57.25% 飙升至高/极限的 90.2%(+50.70%),适合作为主力通用推理模型。

3、Luna 不宜堆极限算力:适合超低成本快速过滤。建议开高思考,在现在2折的低价情况下,性价比也非常高,价格也同样不贵。

4、选型建议:日常任务用 Terra 中思考,尖端前沿科研与攻坚直接上 Sol 高思考。

DeepSeek 模型测试

模型档位综合均分
(ARC-1/ARC-2)
性能提升单题费用
DeepSeek
V4 Flash
无思考6.95%
11.8%/2.1%
100%
(基准)
$0.0023
(基准)
低思考65.0%
84.0%/46.0%
9.35x
(+835%)
$0.0118
(+406%)
高思考71.5%
87.0%/56.0%
10.29x
(+929%)
$0.0214
(+818%)
极限75.2%
89.0%/61.4%
10.82x
(+982%)
$0.0205
(+780%)
DeepSeek
V4 Pro
无思考6.90%
13.0%/0.8%
100%
(基准)
$0.0234
(基准)
低思考73.4%
90.5%/56.3%
10.64x
(+964%)
$0.1782
(+661%)
高思考73.45%
87.2%/59.7%
10.65x
(+965%)
$0.3071
(+1211%)
极限75.65%
90.0%/61.3%
10.96x
(+996%)
$0.2962
(+1164%)
DeepSeek 思考模式建议

1、告别无思考,低思考是绝对甜点:无思考仅 6.95%,开启低思考均分飙升至 65.0%(+58.05%),单题仅 $0.0118(约8分钱),性价比全场第一。

2、中高思考收益迅速收窄:从低思考切换到高/极限档,均分仅在 71%~75% 徘徊,边际提升有限。

3、 选型建议:日常与高并发流水线锁死“低思考”;若需攻克 85%+ 复杂难题应直接换模型,无需盲目堆满算力

其他前沿厂商

模型档位综合均分
(ARC-1/ARC-2)
性能提升单题费用
Moonshot
Kimi K3
低思考39.05%
65.7%/12.4%
100%
(基准)
$0.181
(基准)
高思考70.85%
86.7%/55.0%
181.4%
(+81.4%)
$0.480
(+166%)
极限77.45%
94.5%/60.4%
198.3%
(+98.3%)
$0.771
(+327%)
智谱
GLM-5
标准24.8%
44.7%/4.9%
100%
(基准)
$0.170
智谱
GLM-5.2
增强49.9%
77.0%/22.8%
201.2%
(+101%)
$0.192
Gemini
3.7 Flash
高思考90.05%
95.5%/84.6%
100%
(单档基准)
$0.120
前沿厂商

思考模式建议 

1、Gemini 3.7 Flash 是 90 分段最大黑马:高思考均分突破 90.05%,单题仅需 $0.120,性价比极高。

2、GLM-5.2 带来代际跨越:相比 GLM-5 均分从 24.8% 翻倍至 49.9%(+25.10%),成本仅微涨 2 美分,建议全面替代 GLM-5。

3、Kimi K3 建议开启高思考:从低思考 39.05% 跃升至高思考 70.85%(+31.80%),是效果与成本的最佳平衡点。

4、选型建议:选型建议:高智商且看重预算首选 Gemini 3.7 Flash,国产推荐 Kimi K3(高思考) 与 GLM-5.2。

03.

标准介绍/;

总结Summary

1. 告别算力盲目狂欢:从无思考切换至低/中思考时得分爆发性增长,但拉满 Max 往往多花 5~10 倍费用却只换来 2% 提升,企业落地首选低/中档
2. 极速降本 80%+:DeepSeek-V4 Flash 与 GPT-5.6 Luna 适合作为系统兜底与大流量前置过滤。
3. 关键难题精准投喂:复杂多步推理交给 Claude Opus 5 或 GPT-5.6 Sol,实现“好钢用在刀刃上”。4.上述模型均已能通过非线智能使用↓↓

 关于非线智能

图片非线智能Nonelinear提供AI项目落地服务9月20日前新用户 充 20 送 20充 值 5000 送 1000全部模型,折扣共享

更多推荐:

Deepseek涨价后有更高性价比的替代吗?

硬核万字评测|最全AI生图横评选型,看这一篇就够了

智谱AI GLM-5.3 实测