8月12日,人工智能领域迎来新一轮技术竞赛,DeepSeek与马斯克旗下SpaceXAI同日发布大模型新版本,分别推出DeepSeek-V4-Pro和Grok 4.6。第三方评测显示,两款模型在智能体能力上均取得突破性进展,性能指标直逼全球头部水平,标志着中美大模型竞争进入新阶段。
DeepSeek-V4-Pro在智能体任务中表现尤为亮眼。官方公布的测试数据显示,该模型在软件工程能力测试DeepSWE中得分62.7,较4月发布的预览版提升近4倍;网络安全测试Cybergym得分从52.7跃升至83.3,终端操作测试Terminal Bench 2.1得分达87.9。与Anthropic的Claude Opus 4.8相比,V4-Pro在五项核心测试中三项领先,两项持平,仅在全栈开发测试DSBench-FullStack中落后6.1分。半导体研究机构SemiAnalysis的对比数据进一步显示,V4-Pro在终端操作测试中领先英伟达Nemotron 3 Ultra达34分。
技术特性方面,V4-Pro支持100万Token上下文窗口和38.4万Token输出,提供思考与非思考双模式运行,并兼容OpenAI与Anthropic的API格式。值得注意的是,尽管性能显著提升,DeepSeek此前预告的API价格大幅上调并未随新模型上线实施。当前定价显示,V4-Pro每百万Token缓存命中输入价格维持在0.025元,输出价格为6元,与预览版持平。不过,官方价格页面仍保留"近期将大幅调价"的提示。
SpaceXAI发布的Grok 4.6则聚焦复杂交互场景。AI评测机构Artificial Analysis最新智能指数显示,该模型以61分追平OpenAI的GPT-5.6 Sol,在视觉任务和长时间运行智能体领域表现突出。成本分析显示,Grok 4.6完成单项测试任务的平均成本为0.84美元,与Kimi K3持平,仅为Claude Opus 5(2.5美元)和GPT-5.6 Sol(3美元)的三分之一。马斯克在模型发布后连续转发多条推文,强调其"智能、快速且性价比超高"的特性。
市场格局正在发生深刻变化。摩根士丹利研报指出,中国大模型API平均价格过去一年上涨明显,输入价格从每百万Token3.3元升至4.9元,输出价格从12.2元升至21.9元,涨幅分别达48%和80%。与之形成对比的是,美国闭源模型价格持续下降,导致中美大模型价差显著收窄。2025年一季度,中国模型输入价格仅为美国的6%,2026年二季度已升至19%;输出价格占比从5%提升至14%。
该机构分析认为,价格竞争转向能力竞争的趋势日益明显。中国厂商通过提升模型性能建立定价权,同时需要维持合理毛利以支撑前沿研发。美国厂商则通过降价扩大市场份额,特别是中低端模型仍有降价空间。Silicon Data的Token价格指数显示,闭源模型价格已从高位降至3.07美元,开源模型价格维持在0.66美元,整体价格水平呈下降趋势。这种变化反映出,模型智能水平而非价格,正在成为决定长期竞争地位的核心因素。