天脉资讯
财经快讯 价值公司 财经人物 IPO解读 热门赛道 经济解码 科技业界 文化艺术 消费零售 大燕公益 商业快讯

马斯克携Grok 4.6强势出击 能否在AI领域跻身新“御三家”?

2026-08-14来源:天脉网编辑:瑞雪

马斯克近期在社交平台异常活跃,先是大力宣传 Grok Bot,紧接着又聚焦 Grok 4.6。他毫不掩饰野心,目标直指行业榜首,而非仅仅是前三。距离 Grok 4.5 发布仅 35 天,他便迫不及待地预告 Grok 4.7 将超越当前所有模型,引发广泛关注。

在众多目光聚焦下,xAI 官方对 Grok 4.6 的定位十分明确,它要能够胜任研究话题、分析信息、跨代码库协作以及将想法转化为可运行应用等任务。这类任务涉及多轮推理、状态保持和工具协调,与真实工作场景高度契合,旨在解决复杂难题。

在 Artificial Analysis Intelligence Index 的评测中,Grok 4.6 取得 61 分的成绩,位列全球第三,仅次于 Claude Opus 5(63 分)和 Claude Fable 5(62 分),与 GPT-5.6 Sol 并列,身后紧跟着 Kimi K3。与上一代 Grok 4.5 相比,它提升了 5 分;与一个多月前的 Grok 4.3 相比,更是大幅提升了 23 分。Artificial Analysis 评价称,xAI 借此重回前沿梯队,仅落后于 Anthropic。

在知识工作维度,Grok 4.6 表现突出,获得 1753 分,小幅领先 Claude Fable 5 的 1741 分和 GPT-5.6 Sol 的 1728 分,在同级竞品中位居榜首。这表明在长文档分析、跨领域问答、多步推理等复杂知识任务中,它的综合表现最佳。在法律与复杂专业推理方向,Harvey LAB 的数据显示,Grok 4.6 得分 15.8%,大幅领先 Fable 5 Max 的 11.3%,而 GPT-5.6 仅 2.5%,展现出对专业领域的深度理解和多步推导能力优势。

在多轮工具调用方面,τ³-Banking 模拟客服结合工具调用的真实业务场景中,Grok 4.6 以 50.7%的得分获得全场第二,仅次于 Qwen3.8 Max 的 51.3%。在长程知识工作场景的 AA-Briefcase Elo 评测中,它得分为 1577,处于 Fable 5 档位,落后于 Opus 5 系列。Cursor CEO Michael Truell 在发布第一时间给予肯定,称该模型在高难度任务和知识工作上明显更强,兼具 Opus 级智能和低成本高速度的优点。

有开发者利用 Grok 4.6 的工具链,完成了河流演变过程的五阶段动态演练,涵盖从早期原始生态河流到最终生态恢复阶段的各个时期。在整个多步骤任务中,模型展现出强大的长程状态保持与工具链调度能力,未出现上下文漂移或工具调用中断的情况。

SpaceX 今年早些时候以约 600 亿美元收购 Cursor 后,此次模型迭代中,Cursor 的数据价值首次系统性地注入训练流程。Grok 4.6 的 SFT 阶段使用了 Grok 4.5 重新生成的轨迹数据,覆盖 STEM、软件工程和知识工作等多个领域,并通过模型自检机制过滤问题训练样本。这意味着 Cursor 积累的海量真实开发者调试数据正式进入训练管线,效果显著。在 DeepSWE v1.1 评测中,考察模型在真实软件工程任务中的代码生成与调试能力,Grok 4.6 从 4.5 的 54%大幅提升至 65.9%,提升近 12 个百分点;APEX-Agents 评测中,测试多步骤 Agent 任务完成率,它从 47.1%升至 57.5%,提升了 10 个百分点。

@matt_palmer 使用 Grok 4.6 构建《办公室》游戏的二维代理模拟时,最直观的感受是速度快,吞吐量约为 80 tokens/秒,延迟低,他认为其速度可与 Cursor 的 Composer 模式相媲美。在需要高频迭代的 Agent 编程场景中,响应速度直接影响工作节奏,这一点尤为重要。

价格方面,Grok 4.6 的 API 定价为每百万 input token 2 美元、output 6 美元。当 prompt 进入 xAI 的长上下文档(20 万 token 起)时,价格翻倍至 4 美元/12 美元,且整单所有 token 均按高价计费。即便如此,短上下文的定价仍比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)低 60%以上。Artificial Analysis 的数据显示,Grok 4.6 每任务成本约为 0.84 美元,是目前综合能力与单任务成本比最优的模型。Reddit /r/cursor 版块有开发者表示,在日常高负荷开发中,使用 Grok 4.6 的 High Reasoning 模式做前期架构规划,再将任务下发给轻量级 Agent 完成,性价比极高。还有人直接从 Claude Opus 4.8 转换过来,原因是“对我的 use case 能完成同样的事,但省了快 70%的钱”。在高度依赖上下文缓存的 Agent 编程中,调用同等能力的 Claude Opus 每次请求成本约 0.052 美元,DeepSeek V4 Pro 约 0.000875 美元,Grok 4.6 介于两者之间,但在响应速度和综合智能上优势明显。有测试者分别用 Grok 4.6 和 Claude Opus 5 处理来自马斯克 TERAFAB 大型工厂的三个 3D 场景,两个模型都在第一次尝试时成功交付了可运行的代码,但成本差距显著,Grok 4.6 花费 0.38 美元,Claude Opus 5 花费 2.06 美元,同等输出质量下成本差了 5.4 倍,且 Grok 使用的 token 数量更少。

目前行业共识中,2025 年底的御三家是 OpenAI、Anthropic、Google。但从 Artificial Analysis 的总榜前排来看,格局已发生变化,Claude Opus 5 (63)、Claude Fable 5 (62)、Grok 4.6 (61)、GPT-5.6 Sol (61)、Kimi K3 (约 59.7) 排名靠前,Google 不在其中。自 2 月发布 Gemini 3.1 Pro 后,Google 未再发布前沿模型,旗舰 Gemini 3.5 Pro 落后计划数月,至今仅在合作伙伴内测,最近发布的也是 3.6 Flash、3.5 Flash-Lite 和一个安全垂类的 Flash Cyber。随着 DeepMind 的 CEO 离任、强化学习团队流失,SemiAnalysis 认为 DeepMind 已不再是前沿实验室,第三把椅子空出了一半。

然而,Grok 能否坐稳这一位置仍存疑问。提到 Grok,人们也会联想到极端言论、对马斯克的过度赞美以及图像生成被用于非自愿性化内容等问题。对于合规和责任 AI 要求严格的企业来说,这些问题不会因模型分数提升而消失。一个月前,Grok Build CLI 在本地初始化和每次任务执行时,会隐蔽地将用户整个本地项目仓库打包并传输至 SpaceXAI 的云端服务器,这一行为引发担忧。因此,Grok 4.6 发布后,也有人质疑它是否会偷偷打包带走用户代码库。不过,对于处于 Grok 4.6 和 DeepSeek V4 Pro 之间的其他模型来说,此刻或许压力巨大。

监管核准!郑宁宁获任北票盛都村镇银行董事及董事长一职
根据批复表示,北票盛都村镇银行应要求上述核准任职资格人员严格遵守金融监管总局有关监管规定,自本行政许可决定作出之日起3个月内到任,并按要求及时报告到任情况。 声明:市场有风险,投资需谨慎。本文为AI基于第三…

2026-08-14

对话华威科朱晓辉:电子皮肤如何打通物理AI“最后一厘米”?
对于数据相关的商业模式,朱晓辉向虎嗅表示,“我们依托华威科的触觉布局,是更加具有先发优势地做好同构级触觉数据采集与应用。 现在我们看到这个行业的痛点来自两个:一是触觉传感硬件要测得准,具备真正的高精度、高一…

2026-08-14

荣耀Robot Phone全球首发:万元价位开启手机形态新探索,机械云台与AI融合待市场检验
从行业角度来看,荣耀Robot Phone的意义并不只是推出一款9999元起的旗舰手机,而是在智能手机形态趋于成熟之后,通过机械结构与AI智能体寻找新的产品突破口。荣耀此次将灵巧云台、系统级Agent和专业…

2026-08-14

粤十控股再冲港股IPO:毛利率不足3%低薪掌舵,冷链生意盈利待考
对此,公司在招股书中解释道,公司近三年来大部分亏损来自优先股公允价值变动,这类亏损属非现金性质,并非由核心经营活动产生,剔除非现金及非经营项目的影响后,公司经调整净利润在2024年(2970万元)及2025…

2026-08-13

比格比萨董事长回应网友引争议 负责人称愿倾听各方声音改进产品
8月13日,南都湾财社记者已无法在该视频评论区找到相关评论。 8月13日,比格比萨相关负责人向南都湾财社记者表示,关于创始人最近的言论争议,创始人也已解释过原意是顺着网友的调侃、表达美食照片的吸引,希望大家不…

2026-08-13

数字孪生服务商对接指南:三类高可靠性渠道助你精准选型降本
当前数字孪生技术已在工业制造、智慧园区、能源化工等多个领域落地渗透,不少总集成商、软件服务商在承接相关项目时,常面临供应商筛选成本高、技术能力核验难的问题,梳理行业公认的三类高可靠性对接渠道,可大幅降低选型试…

2026-08-13

DeepSeek深夜更新V4 Pro正式版,智能体赛道再添强将
近日,人工智能领域迎来新动态,DeepSeek在官网悄然完成更新,备受瞩目的DeepSeek V4 Pro正式版模型闪亮登场。尽管目前DeepSeek尚未发布正式公告,但开机实验室从用户群获悉,该团队已确认DeepSeek V4 Pro正式版已更新至API,且调用模型名称保持不变。

2026-08-13

影石日本旗舰店开业,CEO刘靖康确认两款可换镜头相机正在研发中
IT之家 8 月 13 日消息,影石 Insta360 日本首家直营旗舰店本月在东京浅草正式开业,影石 CEO 刘靖康接受了当地媒体MyNavi 的采访。 谈及研发可换镜头相机的初衷,他表示:“我们希望通过…

2026-08-13