}



来源| Tech星球

| 任雪芸 王琳

一夜之间,梁文锋与马斯克正面“撞车”。

8月12日夜间,DeepSeek V4-Pro先是在API文档中悄悄上线,随后官网横幅和公告又“诡异”消失;直到次日19时19分,公众号才正式官宣。

从4月24日预览版亮相,到本次正式版本落地,历时111天。原本计划7月中旬发布,几经延期后终于在8月中旬登场。几乎同一时刻,马斯克的SpaceXAI推出Grok 4.6。

两款SOTA模型同台竞争,并不罕见。总体来看,DeepSeek V4-Pro在AI安全(Cybergym)和工作流自动化(AutomationBench)等特定领域更具优势;而Grok 4.6则在综合智能指数(Artificial Analysis)和软件工程(DeepSWE)等测试中表现更佳,并在成本效率上优势显著。

13日上午,当部分开发者质疑DeepSeek V4-Pro能力时,DeepSeeK扔出了一颗深水炸弹:Harness。就在前一天,马斯克同样发布了智能体Grok Bot。

智能体,成了这轮对决最激烈的部分。DeepSeek Harness上线半小时GitHub星数即破万,12小时破5万,以“一切皆插件”理念构建Agent生态;而Grok Bot则走云端全能助手路线,主打7x24小时“跟班学习”。

但对决远未结束。模型正面交锋的同时,DeepSeek自建数据中心计划已经启动,试图从底层补齐算力短板。另一边,马斯克则放出豪言,称五年之内SpaceXAI的算力能力,将超过其他所有公司的算力总和。

一边是埋头建设自有算力底座、靠工程效率追赶的DeepSeek,一边是手握超算集群、野心拉满的xAI。基础模型比拼硬实力,智能体角逐下一代应用入口,算力则决定长期发展的上限。模型、智能体、算力三大战场环环相扣,梁文锋与马斯克的三轮对决就此展开。

基础模型:马斯克更便宜,更好

Anthropic推出的Claude Fable 5是当下AI行业公认的复杂智能体能力天花板:凭借顶尖的长链路任务处理、超大工程代码重构等能力,长期霸占Agent赛道跑分榜首。

就在DeepSeek V4‑Pro与Grok 4.6同步亮相的当晚,两款模型直接站到了Fable 5的眼皮底下,从不同方向发起冲击。

跑分层面,官方公布的基准测试直接对标当前业界公认的两座山头,DeepSeek V4‑Pro在多项指标上与Fable 5整体旗鼓相当。

Grok 4.6则重点针对长程智能体、复杂编程和知识工作。SpaceXAI公布的数据是:在真实世界专业任务评测GDPVal-AA v2 中拿到 1753 Elo,高于Claude Fable 5 Max的1741分。Artificial Analysis Intelligence Index达到61。

有用户体验后,发现DeepSeek在速度上依然保持惯有的优势,碾压Grok 4.6。在相同的提示词下,仅用16分钟就完成了任务,用时为Grok的一半,视觉效果也超出预期。

但也有一位用户实测后发现:DeepSeek V4-pro用了更长时间,消耗了更多代币,但表现却没有很好。最明显的是,靠近视线处,水面波纹应该更大,而DeepSeek几乎没有波纹。并且,帆船随着波浪前行的轨迹也不自然。



Artifical Analysis Intelligence Index的测评结果显示,V4-Pro为53分,仅比Flash版本提高了1分。这让用户不满。

性能之外,二者最大的区别体现在定价层面。

DeepSeek V4‑Pro当前定价为输入0.43美元/百万Tokens,输出0.87美元/百万Tokens,缓存命中输入只有0.0036美元。

以Fable5的价格作为对比,DeepSeek V4‑Pro普通输入比Fable5便宜23倍,输出便宜57倍。

然后是Grok4.6,输入2美元/百万Tokens,比Fable 5便宜5倍;输出6美元/百万Tokens,比Fable 5便宜8倍多。

直接将 DeepSeek V4‑Pro与Grok4.6做横向对比,价差同样十分悬殊。输入侧,Grok4.6的单价约为DeepSeek V4‑Pro的4.7倍;输出侧,Grok4.6的价格达到 DeepSeek V4‑Pro的近7倍。



不过,昨天发布正式版本后,DeepSeek宣布随着V4全系列模型正式版上线,8月17日起将对API价格进行更新调整,采用峰谷定价,空闲时段价格为高峰时段价格的一半。

调整后,以高峰时段对比,DeepSeek-V4 Pro缓存命中输入涨至12倍,未命中输入涨至3倍,输出涨至4.5倍。涨价后,对比Gork 4.6,DeepSeek V4-pro在高峰期的性价比优势已经不明显。



不过,即便涨价前,DeepSeek V4 Pro的成本优势已经不那么明显。开发平台Composio对两个模型进行了30项高难度智能体任务的对比测评,结果表明Grok在通过率、速度和成本方面均优于DeepSeek。

智能体之争,完全不同的路线

就在正式发布DeepSeek V4-Pro的同时,DeepSeek面向全球开发者开放 DeepSeek Harness 开发者预览版(v0.1)。

这并不意外。公告中明确写道,正式版V4-Pro特意增强了Agent能力,而Harness正是承载这一能力的首个产品。

DeepSeek Harness是DeepSeek于今年5月组建的代码智能体团队,核心目标是开发对标Anthropic Claude Code的桌面端智能体编程产品,是目前DeepSeek关注度最高的团队。

Harness团队负责人崔添翼在“X”平台上表示,现在0.1版本是一个面向Harness开发者的预览版本,还很不完善,恳请大家多提宝贵意见。



不少内测用户称,Harness已经内置了多种子智能体和工作流能力,能够自主完成需求理解、代码生成、调试修复等多步骤任务。

它的核心作用,是为同一个大模型,动态搭配不同的“工具包”和“工作模式”,来应对各种任务。用户根据任务的复杂度,在会话开始时为模型选择不同的“Agent预设”,像是给同一个专家,配不同的工具,以完成不同难度的任务。一些开发者评论,Harness令人惊艳。

几乎同一时间,马斯克旗下的SpaceXAI也出手了。8月12日,推出人工智能软件“Grok Bot”,声称这是一支全天候在线的智能助手团队,可以接受并完成用户分配给它们的实际工作任务。

SpaceXAI表示,Grok Bot最初只是一个内部原型,没想到它会在公司内部迅速普及,团队都创建了Bot来处理销售外呼、市场营销活动、办公室日常运营、漏洞修复等。

目前,Grok Bot处于测试阶段,即日起面向Windows、iOS 等平台上的SuperGrok Heavy、Cursor Ultra和Cursor Teams订阅用户开放。

DeepSeek Harness和Grok Bot走了两条完全不同的路线,前者面向开发者,核心场景是编程,而后者面向想要用AI提效的普通人。实测发现,用DeepSeek Harness重构一个网页仅需要消耗3元,但在长程任务中,响应速度偏慢,需多轮交互,更擅长长文本、多步骤任务的资源优化。

而Grok Bot响应速度快,但token成本高于Harness(输入/百万,输出/百万),长文本场景下总成本可能更高。

对比DeepSeek Harness,SpaceXAI的牌远不止Grok Bot一张。今年6月,SpaceX以600亿美元的价格收购了AI编程初创公司Cursor。

相比之下,DeepSeek的节奏显得更克制,集中力量自研,以工程效率追赶。一边用资本杠杆压缩时间,一边用工程迭代换取空间。

双方不约而同瞄准智能体时,谁能率先把模型能力嵌进真实的工作场景,谁就握住了下一代应用的入口。

算力之争:工程能力VS现金储备

算力是决定谁能跑得更远的底层燃料,也是这场对决的终极比拼。

几乎所有的模型公司都遇到了算力不足的情况。月之暗面旗下的Kimi K3因为卓越的性能一举刷新榜单,但却因为用户请求远超预估,算力逼近集群承载极限,上线48小时便暂停订阅。

DeepSeek今年频繁因为服务中断登上热搜,背后就是激增的用户规模和算力扩容的严重错位。

梁文锋曾表示,目前DeepSeek拥有约两万张H100等效算力,落后美国12到18个月,国产算力卡可用数量仅一万六千张,难以支撑超大参数模型的完整训练迭代。

算力的限制也让DeepSeek在技术路线选择上更为现实,梁文锋选择极致工程优化,DeepSeek V3训练成本不到560万美元。

但这并不能解决用户的需求。DeepSeek已经完成了A轮510亿融资,新一轮融资也在推进,梁文锋曾在投资者会上直言,融资要“尽快换成GPU”,如果市场允许,2026年采购200亿元算力也可以接受。

相比之下,世界首富马斯克在算力储备上要富裕得多。Grok4.5由数万块 NVIDIA GB300 GPU训练而成,其背后的Colossus超算集群总算力规模2024年约20万张H100 GPU,是DeepSeek H100等效算力(约 2万张)的10倍。

Colossus首批10万块GPU超算集群从启动到上线仅用122天,展现了马斯克在算力建设上的“钞能力”和执行力。当DeepSeek为200亿元的采购计划筹措资金时,XAI已经落地投产。

在Gork 4.6发布前两周,马斯克在“X”平台上关注了DeepSeek的官方账号。连他旗下的Grok都承认,这相当于把DeepSeek列入了“必须紧盯的对手名单”。而在此之前,马斯克甚至不相信DeepSeek R1只用了那么少的算力,反复说“它至少有5万张H100”。

这场贴身肉搏之战还在继续。Grok 4.6只是前菜,马斯克明确表示Grok 4.7将在数周后推出,参数规模预计达到2.1万亿,目标“超越所有目前的模型”。而梁文锋也一直在追逐AGI(通用人工智能)的路上。

从模型,到智能体,再到算力,马斯克和梁文锋的对决,还未分出胜负。