今天,这一架太魔幻了!
一边是梁文锋,终于在凌晨放出了DeepSeek V4 Pro正式版。
另一边,马斯克砸下了下一代旗舰Grok 4.6,主打一个成本低,性能强。
两大巨头,同一时间发布,火药味儿瞬间拉满。

他们盯上的,几乎是同一件事——
让模型能在长任务里持续调用工具、修改代码、验证结果,最后交付一个真正能用的成品。
01
DeepSeek V4 Pro来了
马斯克Grok 4.6出战
DeepSeek V4 Pro正式版最亮眼的成绩,是在两项评测中拿下绝对第一,直接反杀Fable 5。
网络安全智能体测试CyberGym拿到83.3分,超过Fable 5的83.1分、Opus 4.8的78.3分。
自动化任务AutomationBench拿到31.8分,把Fable 5的29.1分和Opus 4.8的27.2分一起压了下去。
最「贴脸」的一次,则发生在Terminal-Bench 2.1。
DeepSeek拿到87.9分,超过Opus 4.8的85.0分,距离Fable 5的88.0分,只差0.1。
其他几项高难度Agent测试中,DeepSeek则实现了对Opus 4.8的绝对跨越。
带工具的「人类最后考试」中拿到60.0分,反超Opus 4.8的57.9分,继续逼近Fable 5的63.0分。
就连此前最薄弱的软件工程智能体,DeepSWE也从预览版的12.8分暴涨到62.7分,接近原来的4.9倍。
这个成绩不仅超过Opus 4.8的58.0分,距离Fable 5的70.0分也只剩7.3分。

同一时间,马斯克也把Fable 5和GPT-5.6 Sol架在了火上烤。
Grok 4.6先是在综合能力上追平GPT-5.6,再在编码测试中连续完成反超。
综合智能指数上拿到61分,距离Fable 5的62分只差1分。
CursorBench上拿到69.9%,超过GPT-5.6的67.2%,距离Fable 5的70.5%只有0.6个百分点。
FrontierCode上拿到61.3%,也压过GPT-5.6的60.6%,继续紧追Fable 5的63.6%。
到了更接近真实职场交付的知识工作中,Grok 4.6直接翻身反杀,在三项评测中全部拿下第一。
GDPval-AA v2中拿到1753 Elo,超过Fable 5的1741,也超过GPT-5.6的1728。
AA-Briefcase上再拿1577 Elo,压过Fable 5的1574和GPT-5.6的1502。
专业法律任务Harvey LAB中拿到15.8%,Fable 5只有11.3%,GPT-5.6更是只有2.5%。

更狠的是,DeepSeek V4 Pro和Grok 4.6不仅在性能上直逼OpenAI和Anthropic的顶尖模型,还一起把前沿智能的价格打了下来。
每百万输出Token,Grok 4.6要6美元,GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元。
而DeepSeek只要0.87美元——
约为Grok 4.6的1/7、GPT-5.6 Sol的1/35、Claude Opus 5的1/29、Fable 5的1/57!


02
全网首测
DeepSeek大战Grok
现在,第一批实测已经出炉。DeepSeek
V4 Pro和Grok 4.6,也终于从跑分榜走进真实任务场。
第一轮,我们直接给DeepSeek上强度。
只用一条提示词,它便在浏览器中从零搭出了一颗完整的3D交互式地球。
拖动、旋转、缩放等基础交互全部可用;全球数据流、动态航线和地理标记,也被完整铺在地球表面。
再往细节看,大气层散射、云层渲染、昼夜光影乃至整套UI界面,同样一应俱全。

接下来,直接把两款模型拉进同一个擂台。
AI博主「向阳乔木」先用DeepSeek V4 Pro连跑三个小任务,随后又把其中两道题的相同提示词交给Grok 4.6,直接对比最终成品。
第一个任务,是调用3个Skill开发并部署一个网站。
DeepSeek顺利跑通了整套流程,从页面设计和完成度来看,整体表现非常稳定。
第二个任务,是一次复刻60种设计风格,并生成一整套Bento卡片集中展示。
这一轮,DeepSeek在字体、配色和版式上做出了明显区分,整体视觉效果相当不错。
最后一个任务,则是从零生成一款3D打砖块游戏。
游戏不仅可以直接上手,还加入了立体场景、背景音乐和动态音效,操作反馈和可玩性全部在线。



随后,相同的提示词被交给了Grok 4.6。
在3D打砖块这一局中,两款模型几乎打成平手。
Grok生成的游戏同样质感在线,无论视觉效果、场景完整度还是可玩性,都与DeepSeek V4 Pro不相上下。
到了60种Bento设计这一局,Grok 4.6则扳回一分。
它生成的部分页面,在排版、配色和视觉层次上更为成熟,最终效果也更加好看。


更激烈的对决,发生在Flappy Bird上。
开发者Jun Song给出完全相同的提示词,让DeepSeek V4 Pro和Grok 4.6分别从零「手搓」一款游戏。
结果,两款模型走出了截然不同的路线。
DeepSeek V4 Pro消耗超过2万Token,成本仅为0.019美元;Grok 4.6只使用约5000 Token,成本却达到0.03美元。

但从最终成品来看,这一局DeepSeek明显更胜一筹。
游戏中不仅有山脉远景和层叠云朵,水管也带有渐变与体积感。角色穿过水管时,画面甚至会弹出「+1」的浮动动画。
从场景层次到操作反馈,细节几乎全部拉满,端到端构建的完成度明显高于Grok 4.6。
在开发者Hamza进行的另一项前端测试中,DeepSeek V4 Pro再次拿下Grok 4.6。
无论页面完成度还是最终视觉效果,V4 Pro交出的成品都更胜一筹。

不过,V4 Pro也没有场场封神。
在一组鹈鹕对比测试中,相较于Flash版本,V4 Pro的整体画面完成度更高,大象的造型也更加美观。
唯一的问题是——鹈鹕的运动方向,被完全画反了。

继续增加难度,让DeepSeek V4 Pro、GPT-5.6 Sol和Claude Opus 5使用Three.js生成同一棵樱花树,差距就更加明显。
无论是树干与枝叶的细节,还是光影、景深和整体氛围,V4 Pro都不如另外两款顶尖模型。



DeepSeek V4 Pro;GPT-5.6 Sol;Claude Opus 5
几轮实测看下来,DeepSeek V4 Pro和Grok 4.6确实已经打到了同一水平线,难分伯仲。
03
两大AI同一天
追上了OpenAI和Anthropic
对于这两款模型的同时爆发,大佬Rick De Oliveira给出的评价是,「强大,而且实惠。」
这DeepSeek V4 Pro和Grok 4.6的加持下,这两个几乎不可能同时出现的词,在今天,第一次真正走到了一起。
从网络安全、知识型任务到Agent自主解决问题,它们已经在多个战场上,凭借着更低的成本直接击碎了前沿能力的天花板。

回看今天这场魔幻的AI「对轰」,DeepSeek与Grok共同改写了一条游戏规则:
顶尖智能,不再高不可攀。
过去,开发者往往只能在「用不起」和「不够强」之间艰难选择。
而今天,DeepSeek用仅为SOTA几十分之一的价格掀翻桌子,Grok则以极高的性价比紧随其后。
这场「高能低价」的正面冲击,已经撕开了旧秩序的裂口。

而战争还没有结束。
马斯克已经提前预告,Grok 4.7马上就来,目标直指超越所有顶尖AI;OpenAI与Anthropic的反击,也必将接踵而至。


身处这个以「小时」为单位进化的时代,智能不再是少数巨头的特权,属于所有人的应用大爆发,才刚刚开始。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8vYYjBBgWSw

小同爱分享3 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享6 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享