迎面硬碰!DeepSeek V4 Pro撞车Grok 4.6:大模型竞速进入“高智平价”Agent时代 - 花叮网
迎面硬碰!DeepSeek V4 Pro撞车Grok 4.6:大模型竞速进入“高智平价”Agent时代
花叮网小叮
半小时前

综合报道 顶级大模型的前沿阵地迎来极具戏剧性的一幕。梁文锋旗下的 DeepSeek 正式上线 DeepSeek V4 Pro(正式版),与马斯克掌舵的 xAI 最新推出的旗舰模型 Grok 4.6 同日正面交锋。

两款前沿模型不约而同地将核心卖点锁定在长周期智能体(Agent)的自主交付能力上,并在带来顶尖性能表现的同时,以破局者的姿态打破了长期以来“高性能即高价格”的行业铁律。



一、 战场重塑:从“聊天答题”转向“自主端到端交付”

本次两家发布的核心亮点,在于大模型评估维度发生了根本性变革。行业关注点已从传统的问答与短代码补全,全面转向需要自主调用工具、定位错误、自修 Bug 并交付完整工程的 Agent 实战能力

在基准评测中,两款模型均展现出极其强悍的工程落实力度:

  • DeepSeek V4 Pro: 在网络安全攻防测试 CyberGym(83.3)、自动化编排 AutomationBench(31.8)等基准上击败 Anthropic 旗下的 Fable 5。其终端环境操作 Terminal-Bench 2.1 拿下 87.9 分,与 Fable 5(88.0)仅差 0.1 分;更具代表性的是其软件工程智能体 DeepSWE 得分从预热期的 12.8 暴涨至 62.7(提升接近 4.9 倍),一举超越 Opus 4.8(58.0)。
  • Grok 4.6: 在综合智能指数上获得 61 分(与 Fable 5 相当),并在代码智能体基准 CursorBench(69.9%)与 FrontierCode(61.3%)上实现对 GPT-5.6 的超越。此外,在知识工作综合评测(GDPval-AA、AA-Briefcase、Harvey LAB 等)中夺得第一。


二、 价格斩杀线:单位经济学的降维打击

相比于单纯的性能对决,两款模型给行业带来的最大冲击在于推理成本的剧烈下探

在每百万输出 Token 的定价上,Grok 4.6 降至仅 6 美元,比 GPT-5.6 Sol(30 美元)、Claude Opus 5(25 美元)以及 Fable 5(50 美元)便宜了 60% 至 80% 以上。

而 DeepSeek V4 Pro 则把性价比拉到了更为极致的水平——输出 Token 定价仅为 0.87 美元(约合人民币 6 元)。这一价格相当于 Grok 的 1/7,GPT-5.6 的 1/35,更是只有 Fable 5 的约 1/57。这种数量级级别的成本优势,标志着高复杂度长推理 Agent 的大规模规模化部署(Scale-out)彻底具备了商业可行性。

模型输出 Token 单价(每 1M)相比旗舰模型的成本优势
DeepSeek V4 Pro$0.87行业地板价,极致性价比
Grok 4.6$6.00约顶尖闭源模型的 15%~20%
GPT-5.6 Sol$30.00基准高价
Claude Fable 5$50.00传统高价旗舰


三、 实测检验:前端审美质变与细微断层

在真实场景的“vibe coding”与工程实测中,两款模型的表现同样引人注目。

  • 前端审美与工程完整度: DeepSeek V4 Pro 在一键生成 3D 交互地球、包含 60 种 Bento 卡片墙、3D 打砖块游戏等测试中表现稳健,整体结构闭环度极高。
  • 细节表现差异: 在 Flappy Bird 等小游戏对比中,DeepSeek 细节更加丰富(成本仅 0.019 美元,优于 Grok 的 0.03 美元)。但在针对更复杂的渲染与物理逻辑测试时(如樱花树 Three.js 生成),GPT-5.6 与 Claude Opus 5 仍有小幅优势;此外,DeepSeek 在部分极小细节上也出现了偶发瑕疵(如鹈鹕运动方向画反)。


总结:AI 普惠风暴加速,应用爆发在即

马斯克已在社交平台上预告更强大的 Grok 4.7 正在路上。DeepSeek 与 Grok 4.6 的这波“同日高能低价”重击,无疑给依靠高昂 API 定价维持利润的传统模型厂商带来了巨大的定价压力。

随着多步自主工具调用和 Token 消耗成本降低至接近于零,“高智能必高价”的旧规则被彻底打破,围绕 AI 程序员、自动化运维以及知识工作者的 Agent 应用正迎来真正的爆发窗口期。

创建帖子

拖放照片/视频 或
选择一个

编辑帖子

拖放照片/视频 或
选择一个

删除帖子?

删除帖子后不能恢复

收藏到

举报

联系人

官方群