资讯🔥9.0

英伟达震撼首测Vera Rubin,DeepSeek吞吐暴涨30倍!

华尔街见闻·2026/8/25 00:22:02🔗 原文

📌 概要

<p style="text-align: justify;">太炸裂了。</p> <p style="text-align: justify;">就在刚刚,英伟达史上首次公布了下一代旗舰级机柜 Vera Rubin NVL72 的首次片上实测数据。</p> <p style="text-align: justify;">而且,这次实测直接拉来了DeepSeek-V4-Pro,跑最真实的「智能体编

<p style="text-align: justify;">太炸裂了。</p> <p style="text-align: justify;">就在刚刚,英伟达史上首次公布了下一代旗舰级机柜 Vera Rubin NVL72 的首次片上实测数据。</p> <p style="text-align: justify;">而且,这次实测直接拉来了DeepSeek-V4-Pro,跑最真实的「智能体编码」任务!</p> <p style="text-align: justify;">结果令人吃惊:对比当前的主力机皇GB300 NVL72,Vera Rubin的每兆瓦吞吐量最高飙升了30倍、Token成本最高暴降了35倍!</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/0794264c-a14c-4ede-8463-cd04c2a45055.jpeg" title="" /></p> <p style="text-align: justify;">有人惊呼:「我连骗投资人的 PPT 都不敢这么写!」</p> <p style="text-align: justify;">还有网友神评:「以前嫌 H200 三万美元一张贵,现在回头一看,H200 居然连丐版都算不上了。」</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/f201cd87-2c6b-4ff6-9e3c-c2e70cf52e23.jpeg" title="" /></p> <p style="text-align: justify;">让我们来仔细盘一盘。</p> <p style="text-align: justify;">从H200到GB300,真实Agent工作负载的吞吐量提升了最高30倍,成本大致翻倍。</p> <p style="text-align: justify;">从GB300到Vera Rubin,吞吐量再次飙升最高30倍,整机架价格大致再翻倍。</p> <p style="text-align: justify;">按照老黄的摩尔定律,合着这两年英伟达最大的技术突破不是GPU本身,而是让价格贵了4倍,却换来了整整900倍的速度飞跃!</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/214532d5-785f-4d29-947f-9c2878a4fada" title="" /></p> <p style="text-align: justify;">这次,英伟达向所有人宣布了一个反常识的真相:LLM时代结束,Agent时代降临,以前的AI跑分基准,全部作废!</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/d9773ec0-be4c-475b-98be-20d92a337889.jpeg" title="" /></p> <p style="text-align: justify;">与此同时,专为智能体打造的Vera CPU,已被马斯克的SpaceXAI连夜装机,甚至准备直接打上太空.</p> <p style="text-align: justify;">同在今天,英伟达Groq 3 LPX也全面量产。</p> <p style="text-align: justify;">Gemma 4 31B在上面跑,速度简直绝了,直接干到每秒3400个Token。万亿参数模型吞吐,狂飙35倍。</p> <p style="text-align: center;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/dd674c59-c7d6-4e80-afe6-a28bac9fdd82.jpeg" title="" /><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/75b5e579-6386-4e64-8b6d-fc372638f697.jpeg" title="" /></p> <p style="text-align: justify;">这些新纪录,直接让Agent生态的商业格局,从今夜开始重写!</p> <h2>为什么英伟达必须推出Vera Rubin?</h2> <p style="text-align: justify;">OpenRouter的最新数据给出了答案:在真实世界里,一个Agent AI任务消耗的Token数量,是普通聊天对话的15倍!</p> <p style="text-align: justify;">比如,如果让一个Agent为投资决策去研究一家公司,在这个过程中,智能体和子智能体会不断推理,累积的Token成为下一步的输入,长上下文处理,就成为限制智能体AI的最关键要素。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/f22908db-cd29-42a9-beff-9793b62d70f5" title="" /></p> <p style="text-align: justify;">智能体交互次数越多,吞吐量越大——智能体数量多了10倍,工具调用多了2倍,算力和算法的矛盾催生了新的需求。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/7ad9cc09-c082-4331-b55f-041938cc2160.jpeg" title="" /></p> <h2 style="text-align: left;">别拿聊天当智能体,旧基准全废了!</h2> <p style="text-align: justify;">这时候,传统的AI基准测试(如固定长度的8K/1K序列测试)就彻底无效了。</p> <p style="text-align: justify;">英伟达官方挑明:性能测量必须进化!不能再测单一的推理请求,必须捕捉完整的Agent工作流。</p> <p style="text-align: justify;">为此,他们使用了SemiAnalysis 旗下的 AgentX 基准测试。</p> <p style="text-align: justify;">这个测试不再是死板的问答,而是回放真实的、具有上下文增长、工具调用和子智能体生成的「代码编写会话」。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/916393a6-a830-4fd3-a8b7-df2b5cfa4d6e.jpeg" title="" /></p> <p style="text-align: justify;">这就是为什么H200在新的Agent战场上显得力不从心,Vera Rubin注定要称王。</p> <h2 style="text-align: left;">Vera Rubin NVL72 × DeepSeek-V4-Pro:算力怪物来了</h2> <p style="text-align: justify;">为了证明Vera Rubin NVL72的实力,英伟达直接使用开源王者——DeepSeek-V4-Pro (1.6T) 进行片上实测。</p> <p style="text-align: justify;">数据一出,结果惊人——</p> <p style="text-align: justify;">在AgentX工作负载下,Vera Rubin NVL72的每兆瓦吞吐量,比GB300 NVL72最高提升了整整30倍!</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/fecc6332-9a36-41a2-85c5-248b007d717f.jpeg" title="" /></p> <p style="text-align: justify;">请注意,这里对比的不是老旧的H200,而是炙手可热的主力GB300。</p> <p style="text-align: justify;">GB300在同样的DeepSeek-V4-Pro测试中,每兆瓦吞吐量已经比H200提升了15倍。</p> <p style="text-align: justify;">然而Vera Rubin却在GB300的肩膀上,又拔高了30倍,在整个帕累托曲线上又提高了!</p> <p style="text-align: justify;">这意味着什么?</p> <p style="text-align: justify;">对于受制于电力供应的「AI工厂」来说,这直接拓展了物理法则边界。</p> <p style="text-align: justify;">在同样的电力预算下,Vera Rubin能干30倍的智能体活儿。</p> <p style="text-align: justify;">对于兆瓦级甚至吉瓦级的数据中心来说,这相当于凭空变出了30倍的算力资产。</p> <p style="text-align: justify;">而且,NVIDIA DSX MaxLPS 技术可以在 GPU、机架和工作负载层面进行电源管理,能在相同的兆瓦预算内多配置高达 40% 的 GPU,让AI工厂进一步提升了每兆瓦吞吐量!</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/f1619f80-91ed-4de3-a8ee-d1e759cc54a4.jpeg" title="" /></p> <p style="text-align: left;"><strong>Token成本暴降35倍!Agent行业的「账本」彻底重写</strong></p> <p style="text-align: justify;">每兆瓦吞吐量,直接影响的就是每个生成 token 的成本。性能的飙升,带来的最直接后果就是商业模式的核爆。</p> <p style="text-align: justify;">英伟达宣布,Vera Rubin NVL72 生产每百万Token的成本,比 GB300 NVL72 最高降低了 35 倍!</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/02564615-5463-4519-a305-37b51079a2d0.jpeg" title="" /></p> <p style="text-align: justify;">当推理成本呈断崖式下跌35倍时,24小时无休的数字员工将成为现实,ToC端超级应用将迎来大爆发。</p> <p style="text-align: justify;">老黄这一刀,直接切开了Agent应用的时代大门。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/45e2134d-07a6-4004-8b8f-55c73d438490.jpeg" title="" /></p> <p style="text-align: left;"><strong>极致协同设计:老黄是怎么做到的?</strong></p> <p style="text-align: justify;">你可能会问:凭什么能提速30倍?靠的是单颗芯片的工艺吗?</p> <p style="text-align: justify;">显然不是。</p> <p style="text-align: justify;">Vera Rubin NVL72惊人的性能提升,靠的是「极致协同设计」。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/4f89dd1d-389a-4caf-879e-1edff3524dd0.jpeg" title="" /></p> <p style="text-align: justify;">比如分离式服务,分布式KV缓存,KV感知路由,MegaMoE等等。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/1bf312b6-17d9-4ba7-bd1d-a762d65dfc65.jpeg" title="" /></p> <p style="text-align: justify;">另外,NVFP4 量化直接将模型权重压缩到 4 位精度,在不牺牲输出质量的情况下,大幅缩减内存占用,让吞吐量原地起飞。</p> <p style="text-align: justify;">而第六代 NVLink 与大模型MoE,提供了比现成以太网快10倍、延迟低3倍的互联网络,让像DeepSeek这种基于MoE架构的大模型,可以在72个GPU之间行云流水地调用不同的「专家」子网络。</p> <p style="text-align: justify;">这早已不是在卖显卡,老黄卖的是一整套「AI发电厂」。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/eca3c9af-f7b5-48d1-a453-3b713aa547c4.jpeg" title="" /></p> <h2 style="text-align: left;">英伟达Groq 3 LPX 全面量产:3400 Token/秒,代码Agent变天!</h2> <p style="text-align: justify;">这次Hot Chips 2026 大会上,英伟达还抛出一个震撼消息:Groq 3 LPX 开始全面量产!</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/cb3a986c-0796-4ae1-b755-505e11245a20.jpeg" title="" /></p> <p style="text-align: justify;">Groq 3 LPX,是Vera Rubin NVL72 数据中心平台的专属扩展。</p> <p style="text-align: justify;">它是专为这个系统「量身定制」,主打就是一个低延迟推理加速。</p> <p style="text-align: justify;">这项黑科技,是去年12月英伟达豪掷200亿美元从初创公司 Groq 手中买来的。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/c770c49c-b0d2-4898-9546-93fdba62b351.jpeg" title="" /></p> <p style="text-align: justify;">AI智能体会遇到解码延迟的问题,为了终结这一痛点,Groq 3 LPX 巧妙地将庞大的上下文处理与 Token 生成彻底分离。</p> <p style="text-align: justify;">英伟达的解法是,让Rubin GPU处理大规模上下文,把极速生成Token的任务交给Groq 3 LPX。</p> <p style="text-align: justify;">一个管「读」,一个管「写」,各干各最擅长的。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/bdd7d00d-b40d-4c58-ba71-57fb6641e9e9.jpeg" title="" /></p> <p style="text-align: justify;">在一个完整的机架级部署中,多达 256 个 LP30 加速器可以通过超高带宽互连与 GPU 协同作战,构造出企业级规模的推理引擎。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/1ffa8a65-c209-424b-8c88-88791c267e3d.jpeg" title="" /></p> <p style="text-align: justify;">由此,Groq 3 LPX直接达到了破纪录的输出速度。</p> <p style="text-align: justify;">在 Artificial Analysis 的基准测试中,Groq 3 LPX 在 10 万 Token 超长上下文窗口下运行Gemma 4 31B,输出速度达到惊人的3,400 Token/秒!</p> <p style="text-align: justify;">这使得它在延迟极度敏感的工作负载中,响应速度比竞品快了4倍。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/ed90d9c7-8b2d-4a36-a870-3b1b5bc5dec2.jpeg" title="" /></p> <p style="text-align: justify;">过去几个小时才能完成的多步智能体任务,现在几分钟内就能完成!</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/ef8e7fb5-4899-4c8c-b0db-8e2136fd9d65.jpeg" title="" /></p> <p style="text-align: justify;">Groq 3 LPX在生成5000 Token,所用时间从50秒降至1.5秒,34倍差距。</p> <p style="text-align: justify;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/4d9f3534-f094-4bea-be3d-afb05c69c628.jpeg" title="" /></p> <p style="text-align: justify;">而且在编码任务中,Groq 3 LPX最大输出速度6981 token/s。</p> <p style="text-align: justify;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/9e45e3c4-dd68-4534-8fe1-a1e157ebde46.jpeg" title="" /></p> <p style="text-align: justify;">黄仁勋直言,通过 LPX 推进超高速 Token 生成,在 AI 吞吐量和响应能力上实现了「又一次巨大飞跃」。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/b7353af7-bf84-495e-9a25-1ee845030794.jpeg" title="" /></p> <p style="text-align: justify;">Nebius已经在Nebius Token Factory 中部署该芯片,让智能体循环的每一步都能获得即时响应的极致体验。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/50e1bd33-fc44-4ead-8e98-914c1d6a0dac.jpeg" title="" /></p> <p style="text-align: justify;">紧随其后的,还有Groq自己。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/66e80f9d-084d-4351-94b1-fe079c3a20c8.jpeg" title="" /></p> <h2 style="text-align: left;">首款Agent专属CPU发布,马斯克连夜「打上太空」!</h2> <p style="text-align: justify;">这次官宣中,最具野心的一步棋,就是 Vera CPU了。</p> <p style="text-align: justify;">为了Agent,英伟达专门造了一颗CPU。</p> <p style="text-align: justify;">Vera这颗CPU,就是专门喂饱智能体的,</p> <p style="text-align: justify;">它配备了88个自研的Olympus核心,高带宽的LPDDR5X内存,带宽直接干到1.2TB/s。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/94212de2-1777-482f-af67-cbfd7cd15c23.jpeg" title="" /></p> <p style="text-align: justify;">为什么大模型时代需要全新的CPU?</p> <p style="text-align: justify;">Hot Chips现场,英伟达Vera CPU高管直言,「Agentic AI是史上最复杂的计算任务」。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/fa839e42-6546-4553-ae1a-4fa4e71e09e8.jpeg" title="" /></p> <p style="text-align: justify;">一次任务,Agent背后要跑上百步:调用工具、执行Python代码、翻上下文、处理海量数据....</p> <p style="text-align: justify;">这些跑腿调度的活儿,全都压在CPU身上硬扛。因此,英伟达必须给Agent单独造颗CPU。</p> <p style="text-align: justify;">正是看中了这一点,马斯克的 SpaceXAI 连夜宣布,正式规模化部署英伟达 Vera CPU!</p> <p style="text-align: justify;">早在今年5月,英伟达就把第一批Vera样片,悄悄送到了A社、OpenAI、SpaceXAI先「试水」。</p> <p style="text-align: justify;">仅仅3个月后,SpaceXAI 就迫不及待地将其转入全面部署。</p> <p style="text-align: justify;">更疯狂的是,SpaceXAI 正在基于Vera Rubin 平台建设吉瓦级算力工厂,用来驱动Grok。</p> <p style="text-align: justify;">不仅如此,这套算力,还要被直接送上太空。</p> <p style="text-align: justify;">马斯克表示,「两家强强联手,设计了一款优化版的Vera Rubin NVL72,将在2028年大规模部署」。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/542904e5-5bf5-4521-8fae-751245562a44.jpeg" title="" /></p> <p style="text-align: justify;">SpaceXAI的第一代「Starmind」AI卫星,就计划采用Vera Rubin NVL72 机架级系统。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/f4ad42a9-d3ee-4c82-8ffc-c66906d1e563.jpeg" title="" /></p> <h2 style="text-align: left;">从一块GPU,到整座Agent工厂</h2> <p style="text-align: justify;">同一天,两大芯片Vera CPU和Groq 3 LPX,全面量产。</p> <p style="text-align: justify;">这对英伟达来说,意义重大。</p> <p style="text-align: left;"><img alt="图片" class="wscnph" src="https://wpimg-wscn.awtmt.com/ad23c705-3b41-4d10-a841-dca1e9c1001d.jpeg" title="" /></p> <p style="text-align: justify;">大模型时代,英伟达靠GPU拿下训练和推理。</p> <p style="text-align: justify;">Agent时代,它的版图已经延伸到CPU、推理加速器、NVLink等等。</p> <p style="text-align: justify;">老黄卖的,早已不只是一块GPU。</p> <p style="text-align: justify;">他要卖的,是一座可以不断生产Token的AI工厂。</p> <p style="text-align: justify;">老黄这一次,是要给整个「Agent时代」重新铺一遍地基。</p> <p style="text-align: justify;"><span style="color: #b3b3b3;">本文来源:<span style="color: #1482f0;"><a href="https://mp.weixin.qq.com/s/TOz7SHlyAvX5P7PIXFpm4w" rel="noopener" style="color: #1482f0;" target="_blank">新智元</a></span></span></p><div style="color: #666; margin-bottom: 15px;">风险提示及免责条款</div> <div> 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。 </div>