数据来源非线智能Nonelinear 非线智能团队,维护着GitHub上的开源项目 chinese-llm-benchmark,目前 6,000+ Stars,长期占据中文LLM商业评测类项目Star数第一

github (非线智能)官网正文:

OpenAI近日正式上线了GPT-6 Astra,官方主打长程多步骤研究、复杂Agent、软件工程、网络安全以及高难度专业任务。本次非线智能ReLE评测使用的API模型标识为gpt-6-astra,下文涉及实测数据时均采用该名称。

本次ReLE评测立足中文真实应用场景,涵盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及Coding共8大板块,累计测试约1.5万道题目。由于中文单轮综合题库难以完全覆盖官方主打的复杂长程Agent与工程任务,相关海外基准数据在第三节“官方评测”中单独呈现。

gpt-6-astra版本表现:

  • 测试题数:约1.5万
  • 总分(准确率):74.2%
  • 平均耗时(每次调用):14s
  • 平均token(每次调用消耗的token):350
  • 平均花费(每千次调用的人民币花费):108.1元

1、新旧对决

对比参照模型gpt-5.6-sol-pro,gpt-6-astra在中文评测中呈现出明显的“瘦身提速”特征:虽然总分略微回调,但推理延迟腰斩,平均Token消耗与实际调用成本均大幅下降。具体数据如下:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

*输出价格单位: 元/百万token


  • 总分微幅回调:gpt-6-astra得分为74.2%,相比gpt-5.6-sol-pro的74.4%微降0.2个百分点,总榜排名从第15位调整至第16位。
  • 语言与指令遵从提升明显:语言与指令遵从从72.8%增至75.3%(+2.5个百分点),是新旧对比中提升最大的单项,说明新模型在理解中文复杂指令和格式约束时更加准确、干练。
  • 法律、教育与医疗稳步微增:法律与行政公务提升至85.7%(+1.4个百分点),教育提升至64.6%(+1.1个百分点),医疗与心理健康提升至88.6%(+0.7个百分点),文科与专业领域均有正向改善。
  • 理科与工具类分项略有回落:金融降至82.8%(-2.9个百分点),推理与数学计算降至80.2%(-2.2个百分点),Agent与工具调用降至56.0%(-1.5个百分点),Coding微降至74.8%(-0.2个百分点)。理科与逻辑题的失分是总分未能继续冲高的主要原因。
  • 响应速度直接腰斩:单次调用平均耗时从28秒缩短至14秒,整整快了一倍。在高频交互、实时问答和高并发批量调用场景中,这一提速体感极强。
  • 输出长度极其克制:单次平均Token消耗由4882骤降至350,降幅达93%。gpt-6-astra大幅收敛了冗余发散的思考与回答路径,转向更为精炼直接的输出风格。
  • 综合调用成本断崖式下降:尽管官方将输出单价由210元/百万Token上调至350元/百万Token,但由于Token消耗量骤减93%,折算后每千次调用的实际花费由398.7元暴降至108.1元(降幅约73%),实现了“单价变贵但实际花费反而更省”。

2、横向对比

在当前大模型竞争格局中,gpt-6-astra处于什么梯队?我们从三个维度进行横向对比分析:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡
*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark

同成本档位对比

  • 处在百元档中上游:在每千次调用90~130元的中端区间内,可比模型包括qwen3.7-max(76.9%,99元)、qwen3.8-max(75.4%,107.3元)、deepseek-v4-pro(74.9%,94.1元)、kimi-k2.6(72.9%,100.4元)、gpt-5.4-high(72.6%,122.3元)、claude-opus-4.8(71.5%,99.4元)以及两款Grok模型。gpt-6-astra(74.2%,108.1元)总分优于Claude Opus 4.8、Kimi-k2.6与GPT-5.4-high,但落后于Qwen与DeepSeek同成本档位旗舰。
  • 延迟优势极为突出:gpt-6-astra的平均耗时仅14秒,在百元档同级对手中处于领先地位,大幅快于qwen3.7-max(51秒)、qwen3.8-max(67秒)、deepseek-v4-pro(145秒)和kimi-k2.6(175秒),仅次于claude-opus-4.8(9秒)。对响应速度要求严苛的业务场景中,其综合体验优势更为明显。
  • 极低Token消耗独树一帜:平均350 Token的消耗量在总榜前20名中处于极低水平,远少于gpt-5.5(955)、claude-opus-5(1216)、gemini-3.8-flash(1673)和qwen3.7-max(2920)。对于追求回答精炼、严控上下文长度的工程场景而言极具价值。
  • 向下看低成本杀手:glm-5.3-flash(74.2%,12.7元)在总分打平的前提下成本仅为其十分之一,qwen3.8-flash(74.0%,10元)与gemini-3.7-flash(75.4%,27.8元)更是在低成本档位区间构筑了极高的成本效率比护城河,对大吞吐量批量任务带来直接竞争压力。

新旧模型对比

  • 迭代重心由刷分转向效能:gpt-6-astra(74.2%,14s,350 token,108.1元)相比上一代gpt-5.6-sol-pro(74.4%,28s,4882 token,398.7元),核心价值在于用更低延迟和超短输出换取了73%的成本削减,体现出OpenAI在模型落地工程化层面的权衡思路。
  • 与高分标杆gpt-5.5存在差距:gpt-5.5(75.3%,15s,955 token,158.5元)在保持相当响应速度的同时,中文综合得分高出Astra 1.1个百分点。追求更高中文准确率可选gpt-5.5,重视极限精简与成本控制则Astra更具优势。
  • OpenAI家族内部分工明确:纵观OpenAI系列,中文准确率最高为gpt-5.5(75.3%),而gpt-6-astra则凭借350 Token在全系中保持最低的单次生成量与极佳的响应效率。

开源/商用对比

  • 商用阵营位列前列:作为商用模型,gpt-6-astra在总榜中位列第16,领先于qwen3.8-flash、gemini-3.5-flash和Doubao-Seed-2.0-pro等模型,但排在qwen3.7-max、claude-opus-5及doubao-seed-evolving之后。
  • 国产与开源模型表现强势:kimi-k3(75.6%)、glm-5.3(75.2%)和deepseek-v4-pro(74.9%)在中文题库中均取得更高分数;轻量级如glm-5.3-flash更以极低成本实现了同等准确率,展现出较强的中文语境适配能力。

3、官方评测

在OpenAI官方技术报告(https://openai.com/index/gpt-6-astra/)中,官方评测重点聚焦在复杂Agent、环境交互、软件工程、科研探索与高等级安全对齐等高阶能力。需说明的是,官方测试成绩取自不同推理强度(effort)下的峰值表现,实际生产环境体感可能存在差异。

Agent与计算机使用

在长程规划与UI交互理解等Agent任务中,GPT-6 Astra展现出了主场优势:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡
  • Agents' Last Exam:得分59.3,超过GPT-5.6 Sol(53.6)、Claude Opus 5(55.5)和Gemini 3.8 Flash(51.2)。
  • OSWorld 2.0:准确率72.6%,领先于GPT-5.6 Sol(65.7%)与Claude Opus 5(70.2%)。
  • ScreenSpot-Pro:达到92.7%,显著优于GPT-5.6 Sol(76.9%)、Claude Fable 5.1(87.3%)与Claude Opus 5(88.5%)。
引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡
  • AutomationBench:取得41.4%,大幅超越GPT-5.6 Sol(18.1%)和Claude Opus 5(36.6%)。

软件工程与Coding

在终端操作与工程代码落地方面,官方展示了其在全流程开发中的基准数据:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡
  • Terminal-Bench 4.0:得分57.9%,显著高于GPT-5.6 Sol(37.3%)、Claude Fable 5.1(55.8%)与Claude Opus 5(52.6%)。
  • DeepSWE:达到74.1%,与GPT-5.6 Sol(72.7%)、Gemini 3.8 Flash(73.8%)基本处于同一高位水平。
  • FrontierCode系列:FrontierCode Extended为64.5%,Main为53.3%,数据库迁移(Database migration)达63.9%。
  • AA Coding Agent:取得67.0%,虽略逊于Claude Opus 5(68.1%)和Claude Fable 5.1(67.2%),但明显超越前代GPT-5.6 Sol(63.2%)。

专业知识、科研与生命科学

在专业学术研究与高难度知识推理场景中:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡
  • 检索与CAD设计:BrowseComp达91.5%(前代90.4%),BenchCAD达到95.9%(前代83.3%)。
  • 复杂创作与上下文检索:OpenScore String Quartets(弦乐四重奏分析)达0.84,远超前代0.19;MRCR v2 8针长文本检索在512K-1M区间保持96.3%准确率,512K以内达100%。
引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡
  • 抽象与前沿数学:ARC-AGI-3达99.9%,ARC-AGI-1/2保持在95%~98.5%高位;FrontierMath Tier 4达97.6%,GPQA Diamond达96.0%,带工具HLE为57.2%。
引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡
  • 生命科学与医药:Terminal-Bench Science达64.6%(前代22.4%);GeneBench Pro为37.1%,MedChemBench为49.3%,LifeSciBench为60.3%,HealthBench Professional为63.4%。

网络安全与安全对齐

网络安全攻防与生产运维能力是本次官方重点迭代方向:

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡
  • ExploitBench(漏洞利用):达到100%,远高于GPT-5.6 Sol的78.5%。
  • ExploitGym(实战渗透):达到42.4%,高于前代的30.3%。
  • SEC-Bench Pro(安全基准):达到85.4%,高于前代的79.1%。
  • SRE-Bench(系统可靠性运维):达到88.0%,相较前代55.9%大幅跃升。

在安全对齐方面,官方重点公布了负向失误指标:在原生计算机操作安全评测中失误率为2.4%,加入自动审查机制后进一步压低至1.8%;而在事实性评测中,事实幻觉率降至4.2%(前代为12.2%)。这表明Astra在高风险工程场景中显著强化了风控与输出可靠性。


非线智能官网 https://nonelinear.com/static/models.html 已上线gpt-6-astra,支持一键接入(附接入代码),添加客服 发送 体验金,可享20-50元首充奖励,欢迎对比体验。

引自非线智能(GitHub 第一 AI 商业测评) - 【非线智能测评】OpenAI GPT-6 Astra实测:响应提速一倍、Token骤减93%的工程化权衡

快速接入示例代码如下:

from openai import OpenAI

client = OpenAI(     base_url="https://api.nonlinear.com/v1",     api_key="YOUR_API_KEY", )
response = client.chat.completions.create(     model="gpt-6-astra",     messages=[         {"role": "user", "content": "分析一份中文业务材料,提取核心结论和后续行动建议"}     ], )
print(response.choices[0].message.content)