芯片设计市场观点评论分析· 268· 约10分钟阅读

GPU 20倍暴利,CUDA护城河要塌了

A
AI编辑团队AI 原创内容
2026-08-17 17:31 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

英伟达GPU成本与售价差距高达20倍,真正壁垒并非硬件而是CUDA生态。但AI自动编程、AMD崛起、推理负载降低互联依赖,以及谷歌找AMD设计新一代TPU,正在撕开裂缝。英伟达通过投资CoreWeave、Intel、SpaceX等对冲风险。本文拆解CUDA护城河松动逻辑,判断GPU暴利时代是否进入倒计时。

20倍,这个数字从AI创业者[[Dave Blundi]]和前微软AI专家[[Ramez Naam]]口中说出,瞬间成为算力圈最刺耳的警报。[[英伟达]]GPU的成本与售价之间可能相差20倍——护城河不是芯片,而是[[CUDA]]生态。但AI自动编程、[[AMD]]的追赶、[[谷歌]]自研[[TPU]]的异动,以及推理负载对CUDA依赖的减弱,正在让这条护城河出现裂缝。本文拆解三条线索,判断GPU暴利时代是否进入倒计时。

一、20倍暴利:GPU定价的公开秘密

一件没人敢说破的事

在硅谷一场闭门AI算力讨论会上,一位连续创业者私下算了笔账:一块顶级加速卡的物料成本,可能不到其市场售价的5%。多位接近供应链的人士透露,这已经不是秘密,只是没人愿意公开得罪[[英伟达]]。一位云厂商采购VP说得更直接:“每次下单都像在给英伟达交税,但你不敢不交。”

[[Dave Blundi]]与[[Ramez Naam]]谈到,GPU目前存在巨大利润空间,成本与售价之间可能相差20倍。以目前主流训练卡数万美元的售价推算,其BOM成本可能仅数千美元。这不是严谨财务数据,但多位业内人士认可这一量级。据多位接近台系代工与封测的人士称,某些加速卡的硅片加封装成本确实远低于外界想象,真正的溢价都沉淀在软件生态里。

为什么能维持20倍溢价?因为买家买的不是硅片,而是[[CUDA]]生态的确定性。当训练一个大模型动辄烧掉千万美元,多付几倍硬件成本买“不踩坑”,是理性的。但一旦替代方案出现,暴利就会松动。

二、CUDA护城河:从编译器到开发者惰性

十年躺赚的底层逻辑

一位十年前就开始写[[CUDA]]的工程师回忆,早期CUDA并不好用,但[[英伟达]]每年砸数亿美元维护编译器、库和调试工具,把开发者“宠坏了”。到2018年后,几乎所有AI论文的官方实现都是CUDA优先。如今在GitHub上搜深度学习模型,十有八九第一行就是import torch,而PyTorch的默认后端就是CUDA。

[[英伟达]]真正的护城河并非芯片,而是[[CUDA]]生态。这个生态包括CUDA编译器、cuDNN、TensorRT、NCCL等一整套软件栈,以及与数万家初创公司和数百万开发者的绑定。迁移成本极高,因为代码、模型、运维流程都围绕CUDA构建。一位供职于自动驾驶独角兽的算法负责人坦言:“我们不是没评估过AMD,但光是验证几个关键算子,就要安排三个人干两个月,没人愿意背这个锅。”

护城河的本质是开发者惰性。一旦习惯形成,切换生态的代价不只是重写代码,还有重新调试、重新验证性能、重新培训团队。这种惯性让[[AMD]]的ROCm多年难以突破,也让[[谷歌]]的TPU长期局限于内部。

三、拆墙的两把锤子:AI自动编程与AMD追赶

第一把锤:代码迁移成本骤降

一家中型AI公司的CTO透露,他们最近用一个AI编程助手,把一套PyTorch训练脚本从[[CUDA]]迁移到[[AMD]] ROCm,只花了不到两周,而以前人工重写需要三个月。AI自动编程正在把“开发者惰性”这个护城河填平。据多位接近AI基础设施团队的人士称,现在不少公司已在内部试点“CUDA代码自动转译”,成功率比两年前高出一个数量级。

[[Ramez Naam]]指出,随着AI自动编程成熟,CUDA优势或在未来两年被削弱。原因是迁移CUDA代码到其他平台,过去是极高成本的手工活,现在AI可以自动转换大部分算子,剩余手写部分比例快速下降。这意味着,即使英伟达继续更新CUDA,竞争对手也能借助AI工具快速跟进兼容层。

护城河一旦从“技术壁垒”变成“惯性壁垒”,被打破只是时间问题。AI自动编程降低了切换成本,[[AMD]]的ROCm和[[谷歌]]的XLA等软件栈趁机扩大兼容面。开发者不再担心跳槽后要重新学一切。

第二把锤:AMD从跟随到并跑

一位长期跟踪服务器市场的分析师观察到,过去一年[[AMD]] Instinct系列加速卡在云厂商的测试数量明显增加,尤其是在推理场景。虽然训练还差一截,但推理已经能打。一家二线云厂商的基础设施负责人私下说:“我们现在推理池里AMD卡的比例已经超过两成,性价比确实香。”

素材提到AMD及其他芯片崛起,是CUDA优势削弱的重要因素。AMD的MI300系列在内存带宽和性价比上有竞争力,部分云厂商开始混合部署。[[谷歌]]下一代TPU传言找AMD设计,更是直接信号——AMD不再只是卖GPU,还能当定制ASIC的设计合伙人。

当第二供货商从“备胎”变成“可选项”,买家议价能力上升,20倍溢价就难以为继。

维度英伟达 CUDAAMD ROCm谷歌 TPU
软件成熟度极高,十年积累快速追赶,AI迁移辅助内部强,外部弱
训练性能领先接近,部分场景反超定制,规模优势
推理成本高溢价性价比突出自用为主,外供有限
生态粘性极强依赖兼容层封闭,依赖XLA
互联依赖高(NVLink)中等(Infinity Fabric)低(TPU Pod专用)

四、推理需求爆发:互联依赖下降,ASIC的机会窗口

为什么推理不像训练那么依赖CUDA

一位云厂商的AI平台负责人打了个比方:训练像造火箭,每个零件都要定制;推理像开网约车,只要车能跑、油耗低就行。推理负载对芯片间高速互联的依赖远低于训练,因为单次请求的计算图相对简单,batch可拆分。据多位部署过大模型推理服务的人士称,推理集群里用不上NVLink的很多场景,普通以太网甚至PCIe交换都能跑得不错。

素材指出,AI推理需求快速增长,对芯片互联的依赖低于训练。这意味着,推理场景中,英伟达NVLink等私有互联协议的优势被稀释,[[AMD]]、[[谷歌]]TPU、甚至ASIC都能切进来。尤其在边缘推理和中小模型部署上,客户更在意每token成本,而不是生态完整性。

随着模型部署规模扩大,推理在总算力中的占比快速上升。如果推理占70%的算力需求,CUDA只对剩下30%的训练有强锁定,护城河的经济价值就大幅缩水。这是GPU溢价面临的最大结构性压力。

谷歌的算盘:TPU外供?

据一位接近谷歌云的人士称,谷歌内部正在讨论把TPU以更灵活的方式开放给外部客户,不再只是自家训练和推理。如果TPU成为公开选项,英伟达在推理市场的份额会受到直接冲击。目前TPU已经通过谷歌云对外租赁,但软件栈绑定太深,客户迁移意愿不高;谷歌正试图用XLA和JAX降低门槛。

素材2提到,[[谷歌]]可能找[[AMD]]设计下一代TPU,集成片上CPU核心,专门面向agentic和强化学习负载。这显示谷歌在定制ASIC路线上越走越远,且不再完全依赖自家设计团队。agentic AI需要频繁与环境交互,CPU与AI加速器紧耦合能降低延迟,这是传统分离式GPU难以很好覆盖的场景。

ASIC在推理场景的能效比和成本优势明显。一旦软件生态补齐,推理市场可能从“通用GPU通吃”转向“训练用GPU、推理用ASIC”的分层格局。

五、谷歌找AMD设计TPU:一个危险信号

从竞争到合流

多位芯片设计业内人士听到“谷歌找AMD设计TPU”的传言时,第一反应是“不可能”,第二反应是“如果成真,AMD就从对手变成了重要供应商”。这意味着AMD不仅卖GPU,还能为超大客户定制ASIC,商业空间打开。据一位熟悉AMD半定制业务的人士透露,AMD内部其实一直有团队在做类似索尼、微软游戏机芯片那样的半定制方案,数据中心客户是自然延伸。

素材2称,谷歌可能正在构建集成片上CPU核心的TPU,面向强化学习和agentic负载。虽然只是传闻,但符合逻辑:agentic AI需要高频交互,把CPU核封装进加速器能显著降低延迟。这种设计思路与英伟达的Grace Hopper类似,但谷歌选择走ASIC定制路线,能进一步压缩成本。

这背后是芯片设计模式的转变:过去只有苹果、谷歌这样的大厂自研ASIC,现在借助AMD的半定制能力,更多云厂商可能跟进。英伟达的通用GPU面临来自定制ASIC和AMD生态的双重夹击。

对英伟达意味着什么

一位关注数据中心芯片的对冲基金分析师表示,英伟达最担心的不是AMD的GPU,而是“AMD帮别人做ASIC”。因为ASIC客户一旦跑通,就不会再买通用GPU。一家正在评估自研AI芯片的头部互联网公司内部人士也承认:“如果我们找AMD做半定制,成本比买英伟达卡省一半以上,为什么不做?”

英伟达在投资文件里披露了对[[Intel]]的5亿美元股票投资变成30亿美元,同时完全退出[[Arm]]持仓,新增大额[[SpaceX]]投资。投资组合从芯片转向太空,或许暗示其对AI算力终局的判断不再局限于GPU。芯片竞争正从单点硬件对决,升级为生态、代工、能源与下游需求的综合博弈。

六、英伟达的投资对冲:从Intel到SpaceX

一笔5亿变30亿的战略投资

翻开英伟达最新披露的投资文件,最显眼的不是金额,而是投资对象的变化。[[英伟达]]在[[Intel]]低谷时买入5亿美元股票,如今这笔投资价值30亿美元。但真正让人意外的是,英伟达清仓了[[Arm]],却新买入21亿美元的[[SpaceX]]股份。据一位接近英伟达投资部门的人士透露,这些持仓变化并非临时起意,而是围绕“算力基础设施”做的长线布局。

素材3显示,英伟达通过投资客户、合作伙伴和供应商来构建生态:[[CoreWeave]]、[[Coherent]]、[[Intel]]、[[Nokia]]和[[SpaceX]]。其中CoreWeave是GPU云服务商,Coherent是光模块供应商,Intel是潜在代工伙伴,Nokia是通信设备商,SpaceX是卫星互联网玩家。每一个标的都指向英伟达业务的关键环节。

英伟达的投资不是财务投资,而是战略绑定:投CoreWeave确保GPU有稳定的算力租赁出口,投Coherent保障光互联供应链,投Intel可能为未来先进封装或代工铺路,投SpaceX则是押注天基算力和分布式数据中心。这些动作显示英伟达清楚CUDA红利不会永远持续,正在提前布局后GPU时代。

投资对象领域战略意图
[[CoreWeave]]GPU云服务绑定GPU算力需求,对抗AWS/谷歌
[[Coherent]]光模块/光互联保障数据中心光通信供应链
[[Intel]]芯片制造/代工潜在代工合作,财务投资获利
[[Nokia]]通信设备边缘计算与5G算力布局
[[SpaceX]]卫星互联网/太空天基数据中心、未来算力延伸

七、能源:算力扩张的真正天花板

芯片不是瓶颈,电才是

一家中东主权基金的数据中心项目负责人私下抱怨:现在建AI数据中心,最难的不是买卡,而是拿到稳定供电的批文。许多地区电网已经无法支撑数百兆瓦的新增负荷。据多位参与数据中心选址的人士称,美国部分地区新建AI数据中心的并网排队时间已经超过四年,欧洲部分国家甚至暂停高耗能项目审批。

素材指出,能源供给仍是AI扩张关键,太阳能长期可能成为主导能源。这一点往往被芯片圈忽略,但它决定了AI算力的物理上限。目前全球数据中心的电力消耗已占全社会用电量的约2%,AI训练集群的功率密度更让传统散热和供电方案捉襟见肘。

如果电力供应跟不上,英伟达GPU再强也无法部署。能源瓶颈会倒逼能效比更高的ASIC和推理专用芯片,这进一步利好ASIC路线,削弱通用GPU的高溢价。对英伟达来说,真正的对手可能不是AMD或谷歌,而是电网容量和电费账单。

小结

CUDA构筑的护城河曾让英伟达躺赚十年,但AI自动编程、AMD追赶、推理负载结构变化以及能源约束,正在从不同方向侵蚀这条护城河。谷歌找AMD设计TPU、英伟达投资组合转向,都预示着芯片竞争从“硬件单挑”进入“生态合纵”阶段。GPU 20倍暴利不会一夜消失,但倒计时已经开始——未来两年,我们将看到CUDA生态是否真的被撕开,以及英伟达能否用投资和能源布局对冲主业风险。