本文大概
3756
字
读完共需
7
分钟
开发者都有这种纠结,在Codex、CC、Work Buddy这些工具中,到底应不应该给大模型点开思考模式,或者什么情况下才应该开启呢?
不开吧,怕智商、性能不够
开吧,怕智力性能过剩导致浪费
本文就ARC-RRIZE测试法帮你解决这个问题,收藏点赞不迷路
下文评测厂牌包含:
---------
01.
标准介绍/;
ARC-评测方法到底有多牛
ARC Prize由弗朗索瓦·肖莱于 2019 年提出,评估AI面对未知任务时的流体智力、抽象推理与泛化能力的测试。本文数据集取自arcprize.org
平时大家测大模型,无非是考历史、刷高考题、背代码库,那些模型早把互联网数据背得滚瓜烂熟,纯属“开卷作弊”。
但本次数据源ARC-AGI的测试方式不一样,它不靠死记硬背,纯几何因果智商测试。
截止目前为止,没有任何一个模型能全部通关试题集,可见这套测试的含金量


测试规则说明
1、测试逻辑:测试由2组试题集组成,即为ARC-1、ARC-2。每次只给 2~3 张从没见过的彩色色块变换图,让AI现场顿悟背后的空间逻辑,然后自己把测试图画出来。
2、评价严肃:只要有一个像素网格颜色填错,整道题直接判0分(Pass@2两次机会)。
3、打分粗暴:答对率有多高?它到底烧了你多少美刀。
01

测试问题集ARC-1
给出输入输出示例,AI需识别离散色块的几何连通性并做对称染色。这属于直觉感知与单层规则
02
测试问题集ARC-2
色块被赋予了“运算指令”和“动态阻挡”含义,存在多套联动规则。普通单步推理和模板搜索完全失效

02.
厂牌实测结果/;
ARC-AGI评测结果
核心主流模型ARC测试后,散点图清晰反映了当下的产业现状:
智商可以用钱(算力时间)买,但存在明显的边际效用递减!

思考和无思考模式差别对不同模型有不同的影响,下面展开说明
Claude (Anthropic) 模型测试
| 模型 | 档位 | 综合均分 (ARC-1/ARC-2) | 性能提升 | 单题费用 |
|---|---|---|---|---|
| Claude Opus 5 | 高思考 | 92.9% 97.5%/88.3% | 100% (基准) | $0.470 (基准) |
| 极限 | 93.95% 97.5%/90.4% | 101.1% (+1.1%) | $0.700 (+48.9%) | |
| Claude Fable 5 | 低思考 | 83.65% 90.5%/76.8% | 100% (基准) | $0.508 (基准) |
| 中思考 | 87.5% 92.5%/82.5% | 104.6% (+4.6%) | $0.664 (+30.7%) | |
| 高思考 | 91.5% 95.5%/87.5% | 109.4% (+9.4%) | $0.767 (+51.0%) | |
| 极限 | 93.85% 98.5%/89.2% | 112.2% (+12.2%) | $2.110 (+316%) | |
| Claude Opus 4.8 | 低思考 | 75.1% 88.0%/62.2% | 100% (基准) | $0.671 (基准) |
| 中思考 | 81.6% 91.5%/71.7% | 108.7% (+8.7%) | $0.912 (+35.8%) | |
| 高思考 | 82.05% 92.0%/72.1% | 109.3% (+9.3%) | $1.042 (+55.2%) | |
| Sonnet 4.5 / 4.6 | 高/Max | 73.45% 86.5%/60.4% | 100% (单档基准) | $1.19~$2.72 |
1、Opus 5 基线即天花板:高思考均分达 92.9%,拉满 Max 仅微涨 +1.05%,费用却暴涨 49% 至 $0.70,开高思考即可,无需开 Max。
2、Opus 4.8 存在溢价陷阱:从中思考切到高思考仅涨 +0.45%,费用却破 $1.04;需高智商建议直接上 Opus 5(更强且更便宜)。
3、Fable 5 是高智商甜点:中/高思考均分达 87%~91%(单题 $0.66~$0.76),但极限档单题飙至 $2.11,不建议开极限。
4、选型建议:核心攻坚首选 Opus 5(高思考) 或 Fable 5(中/高思考),坚决避开 Opus 4.8 高思考。
OpenAI GPT-5.6 系列测试| 模型 | 档位 | 综合均分 (ARC-1/ARC-2) | 性能提升 | 单题费用 |
|---|---|---|---|---|
| GPT-5.6 Sol (旗舰) | 低思考 | 58.5% 74.5%/42.5% | 100% (基准) | $0.170 (基准) |
| 中思考 | 79.8% 92.5%/67.1% | 136.4% (+36.4%) | $0.220 (+29.4%) | |
| 高/极限 | 95.0% 97.5%/92.5% | 162.4% (+62.4%) | +76%~218% | |
| GPT-5.6 Terra (主力) | 低思考 | 39.5% 60.2%/18.8% | 100% (基准) | $0.090 (基准) |
| 中思考 | 57.25% 77.0%/37.5% | 144.9% (+44.9%) | $0.130 (+44.4%) | |
| 高/极限 | 90.2% 96.5%/83.9% | 228.4% (+128%) | +111%~511% | |
| GPT-5.6 Luna (极速) | 无思考 | 2.05% 3.3%/0.8% | 100% (基准) | $0.0047 (基准) |
| 低思考 | 21.55% 39.5%/3.6% | 10.51x (+951%) | $0.0082 (+76.2%) | |
| 中思考 | 30.7% 54.0%/7.4% | 14.98x (+1398%) | $0.0120 (+158%) | |
| 高/极限 | 75.15% 90.7%/59.6% | 36.66x (+3566%) | +499%~1303% |
1、Sol 统治极限智商:高/极限档均分飙至 95.0%(ARC-2 攻下全场第一的 92.5%),是全场算力正反馈最强的旗舰。
2、Terra 展现中档爆发力:中思考 57.25% 飙升至高/极限的 90.2%(+50.70%),适合作为主力通用推理模型。
3、Luna 不宜堆极限算力:适合超低成本快速过滤。建议开高思考,在现在2折的低价情况下,性价比也非常高,价格也同样不贵。
4、选型建议:日常任务用 Terra 中思考,尖端前沿科研与攻坚直接上 Sol 高思考。
DeepSeek 模型测试
| 模型 | 档位 | 综合均分 (ARC-1/ARC-2) | 性能提升 | 单题费用 |
|---|---|---|---|---|
| DeepSeek V4 Flash | 无思考 | 6.95% 11.8%/2.1% | 100% (基准) | $0.0023 (基准) |
| 低思考 | 65.0% 84.0%/46.0% | 9.35x (+835%) | $0.0118 (+406%) | |
| 高思考 | 71.5% 87.0%/56.0% | 10.29x (+929%) | $0.0214 (+818%) | |
| 极限 | 75.2% 89.0%/61.4% | 10.82x (+982%) | $0.0205 (+780%) | |
| DeepSeek V4 Pro | 无思考 | 6.90% 13.0%/0.8% | 100% (基准) | $0.0234 (基准) |
| 低思考 | 73.4% 90.5%/56.3% | 10.64x (+964%) | $0.1782 (+661%) | |
| 高思考 | 73.45% 87.2%/59.7% | 10.65x (+965%) | $0.3071 (+1211%) | |
| 极限 | 75.65% 90.0%/61.3% | 10.96x (+996%) | $0.2962 (+1164%) |
1、告别无思考,低思考是绝对甜点:无思考仅 6.95%,开启低思考均分飙升至 65.0%(+58.05%),单题仅 $0.0118(约8分钱),性价比全场第一。
2、中高思考收益迅速收窄:从低思考切换到高/极限档,均分仅在 71%~75% 徘徊,边际提升有限。
3、 选型建议:日常与高并发流水线锁死“低思考”;若需攻克 85%+ 复杂难题应直接换模型,无需盲目堆满算力
其他前沿厂商
| 模型 | 档位 | 综合均分 (ARC-1/ARC-2) | 性能提升 | 单题费用 |
|---|---|---|---|---|
| Moonshot Kimi K3 | 低思考 | 39.05% 65.7%/12.4% | 100% (基准) | $0.181 (基准) |
| 高思考 | 70.85% 86.7%/55.0% | 181.4% (+81.4%) | $0.480 (+166%) | |
| 极限 | 77.45% 94.5%/60.4% | 198.3% (+98.3%) | $0.771 (+327%) | |
| 智谱 GLM-5 | 标准 | 24.8% 44.7%/4.9% | 100% (基准) | $0.170 |
| 智谱 GLM-5.2 | 增强 | 49.9% 77.0%/22.8% | 201.2% (+101%) | $0.192 |
| Gemini 3.7 Flash | 高思考 | 90.05% 95.5%/84.6% | 100% (单档基准) | $0.120 |
思考模式建议
1、Gemini 3.7 Flash 是 90 分段最大黑马:高思考均分突破 90.05%,单题仅需 $0.120,性价比极高。
2、GLM-5.2 带来代际跨越:相比 GLM-5 均分从 24.8% 翻倍至 49.9%(+25.10%),成本仅微涨 2 美分,建议全面替代 GLM-5。
3、Kimi K3 建议开启高思考:从低思考 39.05% 跃升至高思考 70.85%(+31.80%),是效果与成本的最佳平衡点。
4、选型建议:选型建议:高智商且看重预算首选 Gemini 3.7 Flash,国产推荐 Kimi K3(高思考) 与 GLM-5.2。
03.
标准介绍/;
总结Summary
1. 告别算力盲目狂欢:从无思考切换至低/中思考时得分爆发性增长,但拉满 Max 往往多花 5~10 倍费用却只换来 2% 提升,企业落地首选低/中档。2. 极速降本 80%+:DeepSeek-V4 Flash 与 GPT-5.6 Luna 适合作为系统兜底与大流量前置过滤。
3. 关键难题精准投喂:复杂多步推理交给 Claude Opus 5 或 GPT-5.6 Sol,实现“好钢用在刀刃上”。4.上述模型均已能通过非线智能使用↓↓
关于非线智能
非线智能Nonelinear提供AI项目落地服务9月20日前新用户 充 20 送 20充 值 5000 送 1000全部模型,折扣共享更多推荐: