天脉资讯
财经快讯 价值公司 财经人物 IPO解读 热门赛道 经济解码 科技业界 文化艺术 消费零售 大燕公益 商业快讯

AI大模型竞争白热化:“斩杀线”攀升,性价比成生死关键

2026-08-05来源:快讯编辑:瑞雪

在人工智能大模型领域,一场激烈的竞争正在上演,行业格局正因“斩杀线”和“毒圈”概念而发生深刻变化。如今,中英文AI圈都用这两个源自电子游戏的词汇,来形容大模型竞争的残酷态势。

2026年7月31日,DeepSeek发布V4 Flash 0731,这一新版模型在Artificial Analysis的Intelligence Index上获得50分,比上一版V4 Flash高出10分。基于Intelligence Index v4.1评测数据绘制的散点图中,纵轴代表Intelligence Index得分,能力越强得分越高;横轴是每任务成本,成本越高越靠右。V4 Flash 0731位于左上角,以其为起点向右下方划出一片区域,该区域内的模型成本更高、能力却更弱,这片区域被中文AI圈称为“斩杀线”,英文则叫Kill Zone(斩杀区)。对于处于斩杀线附近的模型而言,面临的竞争压力如同游戏中不断缩小的“毒圈”,生存空间正被逐步挤压。

Agent的兴起,是大模型行业竞争转向和烈度升级的关键因素。它改变了模型的使用方式,从简单的一次对话转变为完成一项任务。完成任务需要模型连续执行多个步骤、调用外部工具,出错后还要重试,最终交付的是任务结果。这使得单次回答的准确性无法全面反映模型交付任务结果的能力,按token计价的测试也不能准确体现一项任务的支出。例如,2026年5月,美国国家标准与技术研究院下属的CAISI公布DeepSeek V4 Pro评估,将其与GPT - 5.4 mini在7个基准上逐项对比,实际支出从便宜53%到贵41%,同一对模型在不同任务下成本高低甚至会颠倒,可见成本随任务而定,评测口径也聚焦到了“任务”上。

Intelligence Index v4.1的两个坐标轴都以“任务”为评测基准。纵轴的Intelligence Index能力指数,由9个评测加权构成,其中Agents(智能体)占比34%,Coding(编程)占比24%,Scientific Reasoning(科学推理)占比24%,General(通用)占比18%,Artificial Analysis在方法论页面明确表示权重向智能体任务倾斜。横轴的每任务成本,是模型跑完整套Intelligence Index的总成本除以各项评测的任务总数,总成本按input(输入)、cache hit(缓存命中)、cache write(缓存写入)、reasoning(推理)、answer(回答)五类token分别计价,再按各评测在指数中的权重加权。按照这一标准,Claude Opus 4.8 (max)能力得分为56分,每任务成本1.78美元;DeepSeek V4 Pro (max)得44分,每任务成本0.04美元;V4 Flash 0731能力得分为50分,高出DeepSeek V4 Pro (max)六分。能力与V4 Flash 0731最接近的是GPT - 5.6 Luna (max),得分为51分,仅高出一分,且GPT - 5.6 Luna (max)在7月30日下调价格80%后,V4 Flash 0731的每任务成本仍低约60%,凸显了其性价比优势,散点图中左上方也完全空白。

Agent的应用放大了模型之间的成本差距。一次单轮问答消耗数百至数千tokens,而一项Agent任务的tokens消耗量高出数个数量级。模型之间单价差距不变,但最终支出会随消耗量增加而同步扩大。有论文分析八个前沿模型在SWE - bench Verified上的执行轨迹,发现Agent编码任务的tokens消耗为代码问答与代码推理的一千倍。按官方定价,Claude Opus 4.8的输出tokens为每百万25美元,DeepSeek V4 Flash为0.28美元,一次消耗数千tokens的问答,两者支出差额以美分计,但在一项Intelligence Index任务上,每任务成本支出差额接近1.7美元。同时,Agent任务中消耗的tokens还在快速增长,如Artificial Analysis指出Claude Sonnet 5的每任务成本较上一代翻倍,增量全部来自tokens用量增加而非单价上涨,其在Intelligence Index任务上的max档输出tokens较前代高出约40%,在AA - Briefcase和GDPval - AA两项知识工作评测中,智能体轮次约为前代的三倍,消耗量上升使得在模型上的最终支出持续增加。

Agent的应用同样放大了模型之间的能力差距。单轮问答中,能力差异表现为一次回答的准确率差异;而Agent任务由多步骤串联,任一步骤出错整体即告失败,成功率约等于各步成功率的连乘。一次回答准确率为95%与90%相差五个百分点,二十步之后成功率分别为36%与12%,前者接近后者的三倍。Agent常设的重试机制进一步放大了差距,失败发生在长任务中途,重跑需重新支付tokens开销,能力不足将直接转化为额外支出。Agent对模型能力和成本差距的放大效应,直接导致模型分化,性价比落在斩杀线以内的模型,将快速失去市场地位和商业潜力。

Agent还给模型的评测带来了更多变数。7月,Reddit的r/LocalLLaMA上发表的一篇独立评测,测试者将DeepSeek V4 Flash分别接入Pi、OpenCode、Claude Code、Nanocoder四个Agent,执行同一批真实bug修复任务并用同一套评分标准。结果发现四个框架的能力得分落在同一个重叠区间,但消耗的tokens和时间相差四倍。

为了有效对比模型的任务执行能力和成本,Artificial Analysis自建并开源了harness Stirrup,这是一个统一的Agent测试框架,包含E2B沙箱、六个固定工具、250轮上限,所有模型的Intelligence Index跑分都在这个框架里完成。V4 Flash 0731在Terminal - Bench 2.1这项Agent评测上有两个得分,Artificial Analysis使用Stirrup测得79%,DeepSeek在更新日志中公布用自家DeepSeek Harness的极简模式测得82.7%。这表明Agent已成为大模型的主流使用场景,单纯的模型能力分数不能说明全部问题,真正的能力存在于系统层级。

斩杀线意味着一旦模型落入该范围,在市场中往往直接失去竞争力。大模型的切换成本极低,与苹果等拥有网络效应的业务不同,AI大模型的API调用标准化,操作协议开放,开发者可多渠道并行触达用户,用户也不关心底层模型是谁,开发者能快速且低成本自由切换模型。同时,基础模型层进步明显放缓,同质化竞争加剧,同一能力档位的模型之间,只要工程配套完备,切换不会带来交付质量的明显下降。市场份额不随性价比差距线性分配,而是向性价比优者快速聚集,性价比处于劣势的模型将快速失去商业潜力,“斩杀线”之内没有二等奖,所有模型厂商都必须争取第一。

即便模型厂商跟上了竞争节奏,也难以停下。目前,由于模型优化迭代和硬件升级,tokens成本处于快速下降通道,但降下来的成本在激烈的价格竞争中无法转化为利润。2026年7月30日,OpenAI在GPT - 5.6的页面上追加更新,将GPT - 5.6 Luna的价格下调80%,GPT - 5.6 Terra下调20%,次日DeepSeek就发布V4 Flash 0731。只要有一家将降本传导为降价,在“毒圈”不断缩小的威胁下,其余厂商不跟进就得交出市场份额。通过性价比获得的优势可以维持,但难以形成壁垒,大模型厂商进入的不是一座可以筑墙固守的城池,而是一片需要每天争夺的开阔地。

斩杀线还将继续上移,推力来自模型技术进步和基础设施投入。模型仍在不断迭代,V4 Flash 0731的架构与尺寸均未变动,仅重做了后训练,Intelligence Index得分就从40升至50,反超自家V4 Pro (max)的44分。自研芯片、自建算力、应用系统工程化与集成等投入周期长、金额大,具备形成规模壁垒的潜力,一旦转化为模型能力和成本优势,将推动“斩杀线”继续上移。大模型行业的这场竞争,已然进入生死局。

科技赋能公园管理!72台智能机器人“入职”14家市属公园
实际上,从公园到工厂,北京正以“4D场景”为切入点,推动机器人在“乏、脏、险、难”四类场景优先上岗,加速机器人落地实际生产生活,最终目标是在2030年后实现生产作业中的多工种自学操作、商业服务中的多任务自主…

2026-08-05

Cloudflare Wallet上线:为AI智能体打造专属钱包 助力无头支付与身份管理
Account Wallets 账户钱包(账户钱包)面向 Cloudflare账户的所有者与人类用户,支持注资、移除资金及向虚拟钱包委派支出权限; Virtual Wallets 虚拟钱包(虚拟钱包)专…

2026-08-05

马斯克称SpaceX与特斯拉硬件实力强 欲借火箭技术助力数据中心建设
8月5日,在SpaceX(SPCX.US)公布二季度财报的电话会上,SpaceX创始人马斯克在回答提问时表示,SpaceX和特斯拉是地球上硬件实力最强的两家公司。“除了中国之外,也许算上中国也是”。 马斯…

2026-08-05

马斯克预言代码将成历史!AI直出二进制引争议,行业大佬激烈交锋
就在刚刚,马斯克在 X 上甩出一条暴论:代码正在变成下一个汇编,下一步是彻底摒弃它,让 AI 直接生成二进制! 而这正是 Douma 那个「半个世纪前的类比」最薄弱的地方:一个是翻译官,忠实、准确、零发挥;…

2026-08-05

马斯克SpaceX首份财报揭晓:2026年二季度营收大增,净亏损收窄股价仍波动
IT之家 8 月 5 日消息,马斯克旗下 SpaceX 公司昨日(8 月 4 日)公布其上市(6 月 12日在纳斯达克交易所正式挂牌上市)后的首份财报数据。 在 2026 年第 2 季度(截至 6 月 30…

2026-08-05

Waymo联席CEO:纯视觉难达完全自动驾驶 激光雷达等多传感器更可靠
换句话说,摄像头可以匹配人类驾驶水平,可以支撑辅助驾驶产品,但多尔戈夫认为其上限低于无人驾驶车辆必须达到的安全门槛,除非仅在地理围栏区域内以有限速度和低运营密度做演示用途。多尔戈夫表示,一片树叶落在传感器上…

2026-08-05

卓驭科技沈劭劼谈智驾:技术范式未定,企业首要“稳”中求进
对于一汽入股后如何保证独立性的问题,沈劭劼表示,这在双方合作确定后已被问了很多遍,此前可能还会“自证清白”,但如今更多用结果说话。在当年还是用模块化方案这个东西时,的确是有得争的,但现在不太需要争了,它是能…

2026-08-05

英大期货、铜冠金源期货拟任掌门人顺利通过专业能力水平评价测试
上证报中国证券网讯(记者费天元)中国期货业协会最新发布2026年8月4日期货公司高管人员专业能力水平评价测试合格人员名单,英大期货拟任董事长王增业、铜冠金源期货拟任董事长温玥通过测试。 日前,中国证监会发布…

2026-08-05

传统电商遇冷转型,社区团购与直播崛起,马云预言成新零售趋势?
传统电商在线上消费的基本盘依然稳固,但是社区团购和直播等新零售业态,已经是未来民生消费领域不可或缺的重要力量。现如今,马云当年作出的预测,在2026年零售市场中已经得到了明显的印证,传统的电商早已不再是市场里…

2026-08-04

中国航发CS35发动机助力“启直5号”倾转旋翼无人机首飞告捷
来源:中国新闻网记者8月3日从中国航空发动机集团(中国航发)获悉,由中国航发轻动自主研制的CS35发动机配装南京启直航空科技有限公司1.5吨级“启直5号”倾转旋翼无人机,近日首飞成功。 CS35发动机是一款…

2026-08-04