最新消息:关注人工智能 AI赋能新媒体运营

Grok 4.6 登顶 AI 性价比榜:性能追平 GPT-5.6 Sol,价格低六成

科技资讯 admin 浏览

xAI 发布 Grok 4.6:AI 智能指数追平 GPT-5.6 Sol,性价比成最大杀手锏

xAI 正式发布新一代大模型 Grok 4.6,在 AI 智能指数评测中获得 61 分,与 OpenAI 的 GPT-5.6 Sol(Max)并列,仅次于 Anthropic 旗下 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。这一成绩标志着 Grok 4.6 正式进入全球顶尖模型行列,与 OpenAI、Anthropic 的旗舰产品展开直接竞争。

此次升级建立在 Grok 4.5 基础之上,核心改进包括采用模型生成的精选数据进行推理训练,以及引入技术概念训练,同时结合高质量工程数据和优化后的训练策略。

训练方法的关键突破在于形成数据闭环:Grok 4.5 被用于重新生成监督微调数据,覆盖推理、工具调用以及 STEM、软件工程和知识工作等场景。此外,模型还在知识工作、通用编码、内核优化、网页开发和计算机辅助设计等广泛的代理强化学习任务上进行训练,明显针对"智能体时代"的核心应用场景。

智能体基准全面跃升,长周期任务效率突出

在智能体能力评测中,Grok 4.6 进步显著。GDPval-AA v2 达到 1753 Elo,位列第二;DeepSWE v1.1 从 54% 跃升至 65.9%;APEX-Agents 从 47.1% 提升至 57.5%;Terminal-Bench v3.0 从 15.7% 增长至 26%。编码方面,CursorBench v3.2 获得 69.9%,FrontierCode v1.1 获得 61.3%,代理与编程能力均有实质性突破。

更具竞争力的是成本效率。Grok 4.6 定价维持每百万输入 token 2 美元、输出 token 6 美元,较 Claude Opus 5(5/25 美元)和 GPT-5.6 Sol(5/30 美元)低 60% 以上。在 AA-Briefcase 长周期知识工作测试中,Grok 4.6 平均仅需 53 个回合和约 5 亿输入 token,而 Claude Opus 5 需要约 103 个回合和约 20 亿 token——以不到四分之一的资源完成同等任务。

目前 Grok 4.6 已通过 Cursor、Grok Build、API 及 OpenRouter、Vercel、Cloudflare 等平台上线,首周在 Grok Build 和 Cursor 中提供双倍用量优惠,上下文窗口为 50 万 token。随着"同等智能、更低价格"的竞争策略落地,大模型市场的性价比之战正日趋激烈。