
xAI在8月12日发布Grok 4.6。官方将其定位为Grok 4.5之后的一次长程Agent升级,重点面向多步骤任务、代码库分析、研究任务、交互式应用和视觉项目生成。我们对其API版本grok-4.6进行了全面评测,测试其在准确率、响应时间、token消耗和调用花费等关键指标上的表现。
需要说明的是,本次评测侧重中文场景下的综合能力考察,评测维度覆盖教育、医疗、金融、法律、推理数学、语言指令、Agent工具调用以及coding八个板块。Grok 4.6官方主推的长程Agent、视觉交互项目和多步骤工程执行,可以在第3部分结合官方评测数据观察其定位。grok-4.6版本表现:
- 测试题数:约1.5万
- 总分(准确率):69.7%
- 平均耗时(每次调用):144s
- 平均token(每次调用消耗的token):3103
- 平均花费(每千次调用的人民币花费):118.4
1、新旧对决
对比上一代参照模型grok-4.5,grok-4.6的变化并不是总分继续上升,而是在中文综合准确率小幅回调的同时,coding、语言指令和医疗心理健康有所改善。数据如下:


*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark
*输出价格单位: 元/百万token
- 总分小幅回调:grok-4.6总分为69.7%,相比grok-4.5的70.0%下降0.3个百分点,排名从第34位变为第35位。这个变化幅度不大。
- Coding继续改善:coding从71.3%提升至74.2%,提升2.9个百分点,是grok-4.6相对grok-4.5更明确的正向变化之一。这与官方继续强调代码库处理、工程项目和Agent执行的方向基本一致。
- 语言指令小幅改善:语言与指令遵从从65.3%提升至68.7%,提升3.4个百分点。对于中文指令理解、格式约束和任务执行稳定性,这一分项变化值得关注。
- 医疗与心理健康有所提升:该维度从83.7%提升至86.6%,提升2.9个百分点,成为除语言指令和coding之外的另一项主要增量。
- Agent工具调用回调相对更大:agent与工具调用从52.9%降至46.2%,下降6.7个百分点,是本轮新旧对比中最主要的回调维度。
- 法律和金融出现下降:法律与行政公务从86.0%降至82.7%,下降3.3个百分点;金融从84.1%降至83.1%,下降1.0个百分点。教育从58.2%微降至57.7%,推理与数学计算从76.8%微降至76.5%,整体属于小幅变化。
- 响应时间变长:平均耗时从92s增加至144s,增加52s,约增加56.5%。这说明grok-4.6在本轮中文评测中端到端响应更慢,不属于低延迟模型。
- Token和花费略降:平均token从3276降至3103,减少约5.3%;每千次调用花费从125.7元降至118.4元,下降约5.8%。
2、横向对比
在当前主流大模型竞争格局中,grok-4.6作为xAI面向长程Agent和交互式项目的新版本表现如何?我们从三个维度进行横向对比分析:

*数据来源:非线智能ReLE评测https://github.com/jeinlee1991/chinese-llm-benchmark
同成本档位对比
- 约95至140元区间并不占优:grok-4.6(69.7%,118.4元)所处的成本区间中,可比模型包括qwen3.7-max(76.9%,99元)、qwen3.6-max-preview(75.4%,139.2元)、qwen3.8-max(75.4%,107.3元)、doubao-seed-2-1-turbo-260628(73.0%,136.3元)、gpt-5.4-high(72.6%,122.3元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、claude-opus-4.8(71.5%,99.4元)、claude-opus-4.6(70.0%,96.5元)和grok-4.5(70.0%,125.7元)。仅看中文综合准确率,grok-4.6在同成本档位中没有形成优势。
- 速度压力也存在:grok-4.6平均耗时144s,慢于qwen3.7-max(51s)、qwen3.6-max-preview(80s)、qwen3.8-max(67s)、gpt-5.4-high(24s)、glm-5.2(93s)、claude-opus-4.8(9s)和grok-4.5(92s),但快于kimi-k2.6(175s)和doubao-seed-2-1-turbo-260628(218s)。它更接近长输出、长耗时模型。
- 向上看头部模型:qwen3.7-max(76.9%,99元)、claude-opus-5(76.8%,168.8元)、kimi-k3(75.6%,172.4元)、doubao-seed-evolving(75.5%,304.7元)、qwen3.8-max(75.4%,107.3元)和gpt-5.5(75.3%,158.5元)均高于grok-4.6。这里最值得注意的是,qwen3.7-max和qwen3.8-max的调用花费并不高于grok-4.6,但中文综合总分高出较多。
- 向下看低成本替代方案:qwen3.7-plus(73.5%,31.7元)、qwen3.5-plus(73.3%,22.9元)、Doubao-Seed-2.0-pro(72.8%,22.5元)、kimi-k2.7-code(72.6%,49.7元)、deepseek-v4-pro-0424(71.7%,54.3元)等模型以更低花费取得了更高中文综合准确率。
新旧模型对比
- xAI两代模型总分接近:grok-4.6(69.7%)相比grok-4.5(70.0%)下降0.3个百分点,整体可以视为基本持平略有回调。
- 产品方向更偏长程执行:从新旧分项看,grok-4.6在coding、语言指令和医疗心理健康上提升,但在Agent工具调用、法律、金融等维度下降。结合官方定位,它更像是在长程任务、交互项目和工程工作流上继续投入。
- 与近期新模型对比:在本轮榜单中,qwen3.8-max(75.4%)、deepseek-v4-pro(74.9%)、doubao-seed-2-1-pro-260628(74.8%)、gpt-5.6-sol-pro(74.4%)等近期新模型均高于grok-4.6。
开源VS闭源对比
- 闭源阵营中的位置:grok-4.6属于商用闭源模型,在闭源模型中高于Doubao-Seed-2.0-mini(69.3%)、qwen3-max-think-2026-01-23(69.3%)、ERNIE-5.0(67.2%)和gpt-5.2-high(67.3%),但低于qwen3.7-max、claude-opus-5、qwen3.8-max、gpt-5.5、gemini-3.5-flash、gpt-5.4-high、claude-opus-4.8等闭源模型。
- 开源阵营的对比更直接:deepseek-v4-pro(74.9%,94.1元)、kimi-k3(75.6%,172.4元)、qwen3.5-plus(73.3%,22.9元)、glm-5.2(73.0%,110.5元)、kimi-k2.6(72.9%,100.4元)、kimi-k2.7-code(72.6%,49.7元)等开源模型在中文综合总分上都高于grok-4.6。尤其deepseek-v4-pro、qwen3.5-plus和kimi-k2.7-code,以更低花费给出了更高ReLE总分。
3、官方评测
根据xAI官方博客(https://x.ai/news/grok-4-6),Grok 4.6建立在Grok 4.5基础上,重点关注long-running agents以及更复杂的interactive and visual work。官方称它可以在多步骤复杂任务中持续推进,例如研究主题、分析信息、跨代码库工作,或把一个想法转化为较完整的应用和工作产物。
模型定位与训练
官方披露,Grok 4.6相比Grok 4.5进行了更长的补充训练,使用了用于推理和高级技术概念的精选模型生成数据、高质量工程数据,并改进了优化器和训练配方。随后,xAI使用Grok 4.5重新生成跨推理强度、Agent harness以及STEM、软件工程、知识工作等领域的SFT轨迹,并通过模型检查过滤问题轨迹。
在强化学习阶段,Grok 4.6覆盖了知识工作、通用编码以及面向内核优化、Web开发、计算机辅助设计等领域的Agent任务。这个训练方向解释了官方为什么强调长程执行和项目生成,而不是单纯强调聊天或单轮问答。
Agentic Coding与知识工作基准

官方给出了一组覆盖工程、Agent和知识工作的Benchmark结果。为避免重复官方博客全文,这里按任务类型摘取几组与模型定位关系更近的数据:
- 代码工程:CursorBench v3.2中,Grok 4.6 High为69.9%,高于Grok 4.5 High的66.7%;DeepSWE v1.1为65.9%,高于Grok 4.5 High的54%,但低于GPT-5.6 Sol Max的73%和Fable 5 Max的70%。
- Agent任务:APEX-Agents中,Grok 4.6 High为57.5%,高于Grok 4.5 High的47.1%;Terminal-Bench v3.0为26%,高于Grok 4.5 High的15.7%,但低于GPT-5.6 Sol Max和Fable 5 Max。
- 知识工作:GDPVal-AA v2中,Grok 4.6 High为1753,高于Grok 4.5 High的1526;AA-Briefcase为1577,高于Grok 4.5 High的1313。
这些官方结果显示,Grok 4.6相对Grok 4.5在多项Agent、工程和知识工作基准上有改善。
交互式项目与视觉工作
官方表示,Grok 4.6在需要多步骤推进的项目上进行了测试,官方展示的案例集中在把较宽泛的产品想法转化为可工作的第一版:包括研究陌生领域、组织应用结构、实现核心交互,并在多轮反馈中继续完善。官方还提到,在更长任务轨迹中,模型开始表现出更多自测和验证行为,会在继续推进前检查自己的工作。
视觉和交互项目方面,官方称Grok 4.6相比Grok 4.5能够给出更完整的第一版结果,能在一次生成中建立应用结构和视觉语言。
我们非线智能官网 https://nonelinear.com/static/models.html 已上线grok-4.6,支持一键接入(附接入代码),添加客服 发送 体验金,可享20-50元首充奖励,欢迎对比体验。

快速接入代码如下:
from openai import OpenAI
client = OpenAI(
base_url="https://api.nonlinear.com/v1",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="grok-4.6",
messages=[
{"role": "user", "content": "分析大型代码库,规划并执行修复方案"}
],
)
print(response.choices[0].message.content)