跳转至

英伟达三十年:一张显卡如何长成 AI 的基础设施

今天人们把 H100、B200 挂在嘴边时,很少有人知道,英伟达的第一块芯片曾差点让这家公司破产。从 1993 年三个人的工作室,到 2026 年牵动全球 AI 基建的巨头,三十余年间英伟达的每一代 GPU,其实都是对“当时最贵的问题”的一次回答。这篇文章顺着时间线,讲清楚每一代产品背后的问题与赌注——GPU 如何从“画图的卡”变成“算数的基础设施”,以及这条路上,AMD、英特尔和“自己造芯片的人”各自走到了哪里。

另一篇选型文章的定位

本文讲“为什么会有这些卡”,属于历史与逻辑;具体到“某张卡能跑什么模型”的选型指南,见同栏目另一篇《看懂英伟达显卡:从 4060 到 H100,一张卡能跑什么模型》

0 先看一张时间线

年份 标志性产品 当时要解决的问题
1995 NV1 PC 游戏 3D 加速从无到有(一次失败的尝试)
1997 RIVA 128 做出一块玩家买得起、性能能打的 3D 芯片
1999 GeForce 256 把几何变换与光照从 CPU 接管,首次定义“GPU”
2001 GeForce 3 可编程着色器:显卡开始由软件定义
2006 G80 与 CUDA 统一着色器架构,并向通用计算开放
2009 Fermi 让显卡认真做科学计算:双精度、ECC、缓存重构
2012 GTX 580 它跑出了 AlexNet,深度学习由此爆发
2016 P100 与 DGX-1 多卡训练亟需 NVLink;客户不想自己攒机器
2017 V100 张量核心:为深度学习专门制造的计算单元
2018 RTX 2080 实时光线追踪,以及进入消费级的张量核心
2020 A100 训练与推理一体,一张卡可弹性拆分
2022 H100 大模型训练规格,随后变成“一卡难求”
2024 GB200 NVL72 把 72 张卡做成一台“巨型 GPU”
2026 Vera Rubin 全面投产:算力竞争进入下一轮

1 1993–1999:三个人的赌局,和一次差点致命的失败

1993 年,黄仁勋、克里斯·马拉乔夫斯基与柯蒂斯·普里姆三人在一家快餐店定下了创业方向:做 PC 游戏的 3D 加速芯片。当时的背景很简单——PC 游戏正在爆发,但 3D 图形只能靠 CPU 硬算,速度惨不忍睹,一台专门干这活的显卡是行业痛点。

不过第一块芯片 NV1 走偏了:英伟达把它做成了“万能卡”,显卡、声卡、游戏手柄接口全塞进去,连渲染方式都采用了当时非主流的四边形管线,与主流 API 不兼容。结果是市场毫无反应,公司的钱很快烧完,濒临倒闭。

救命的是一纸合同:世嘉为委托开发的主机芯片预付了 500 万美元,芯片虽然最终被取消,但这笔钱让英伟达活了下来。它也由此学会了最重要的一课——不要逆着行业标准做事

1997 年的 RIVA 128 是转折点:低价、快、兼容主流 API,一战成名。1999 年 8 月,GeForce 256 问世,英伟达第一次在宣传中使用了“GPU”这个词——它号称能独立完成几何变换、光照与光栅化,把原本 CPU 的活儿抢了过来。同年,公司上市。所谓“GPU”,从一开始就不是“图形芯片”的意思,而是“抢走 CPU 一部分工作的并行处理器”。1 2

2 1999–2006:可编程,是显卡命运的分岔口

GeForce 3(2001)意义深远:它引入了可编程着色器,显卡第一次允许开发者用代码定义“怎么渲染”,而不再是一套固定的电路逻辑。图形学研究者从此获得自由,也为日后“显卡能做通用计算”埋下了伏笔——毕竟,一块能被软件定义的芯片,最终会被软件定义成任何东西。

2000 年,英伟达收购了曾一度称霸市场的 3dfx——后者因产品迭代失败而破产。1到 2006 年,G80(GeForce 8800 GTX)用统一着色器架构取代了分离的顶点/像素管线,让所有计算单元自由分工。同年,英伟达悄悄发布了 CUDA:一套让程序员用 C 语言在显卡上写通用程序的工具链。3

当时几乎没人觉得 CUDA 有用。普通开发者的问题是:为什么要在一块显卡上算数?图形要的像素算完了,剩下几块算力能干嘛?答案当时只有学术圈和超级计算圈感兴趣:流体、分子动力学、天体物理。英伟达内部也有人认为这是不务正业。但在“摩尔定律在 GPU 上跑得比 CPU 快”这条曲线上,这家公司看到了别人没看到的东西——显卡迟早会算得比 CPU 快得多,而那一天需要有人提前铺好“让软件能用起来”的路。

3 2009–2012:Fermi 的学费,AlexNet 的闪电

2009 年发布的 Fermi 架构是英伟达的第二次豪赌:为“计算”重新设计了整块芯片——加入双精度浮点、ECC 内存纠错、重构缓存体系,性能对标的是超级计算机,而不是游戏。当时的买主只有超算中心:天体物理模拟、石油勘探这类科学计算场景,愿意为“一块能插进服务器机房的显卡”掏钱。

这是在为第二战场交学费,而回报来得比任何人预料的都快。2012 年,AlexNet 凭借两块 GTX 580 完成训练,在 ImageNet 图像识别竞赛中将错误率从上一年的约 26% 大幅降到 15% 左右,一战成名——深度学习时代自那一天开始。4

英伟达的“意外”其实早就准备好了:CUDA 已经打磨了五年,之后的 cuDNN(2014)进一步把深度学习算子变成开箱即用的库。深度学习研究者不需要显卡画图,只需要它算数——GPU 的第二职业,就此转正。

4 2013–2017:把公司押在“深度学习会赢”上

2016 年的 P100 是分水岭:16nm 工艺、HBM2 高带宽显存,更重要的是首次引入 NVLink——GPU 与 GPU 之间直接高速互联,绕过 PCIe 总线。5它的设计目标只有一个:让多块显卡像一块卡一样协同训练模型。同年,英伟达推出整机 DGX-1(8 张 P100 预装调试),标价 12.9 万美元,并把第一台亲手送到了当时只有几十人的 OpenAI。客户不要自己攒机,英伟达就卖整机。6

2017 年的 V100(Volta 架构)则更进一步:张量核心(Tensor Core)首次亮相,一个专门做矩阵乘法的专用单元,吞吐是普通 CUDA 核心的倍数级。7至此,“AI 芯片”这个称谓名副其实——它不再是为图形优化的芯片顺带算点矩阵,而是为矩阵运算设计的芯片。

同一时期还有一条容易忽略的产品线:2014 年的 Jetson TK1 把 CUDA 塞进了巴掌大的嵌入式模块,随后是 TX1、TX2、Xavier——服务无人机、机器人、自动驾驶。2017 年,任天堂 Switch 使用的正是英伟达的 Tegra 芯片。这些产品的逻辑一以贯之:数据中心之外的设备同样需要算力,但它们要的是能效比,不是绝对性能。 这一支线延续到今天,就是 2025 年发布的 Jetson Thor——基于 Blackwell 架构,面向通用机器人与边缘 AI 的实时推理。8

……当然,转型并非一帆风顺。2018 年加密货币泡沫破裂叠加游戏显卡需求下滑,英伟达股价一度腰斩。回头看,那只是大时代前的阵痛。

5 2018–2022:AI 军火商的炼成

2018 年,Turing 架构把实时光线追踪和 Tensor Core 一起带进消费级游戏卡:RTX 2080 首销被抢购一空。光线追踪解决“游戏画面逼近电影”的巨额计算量,而 Tensor Core 则顺手催生了 DLSS——用 AI 把低分辨率画面放大成高分辨率,游戏卡开始“买画图送算力”。

2019 年,英伟达宣布收购 Mellanox。当时许多人看不懂:一家显卡公司买网络设备公司做什么?答案是:当 GPU 数量达到几千片上万片时,芯片之间的通信就是最大的瓶颈。此后 NVSwitch、InfiniBand、BlueField DPU 进入产品矩阵,英伟达从“卖芯片”变成“卖整个数据中心”。

2020 年的 A100 把这种思路推向成熟:支持 MIG 弹性切分(一张卡拆成多个独立实例给不同租户)、80GB HBM2e、训练推理通吃。9同一年的另一面是显卡被加密货币矿工抢购一空,游戏玩家怨声载道——那是算力第一次以“资源”的身份进入大众视野。

2022 年,Hopper 架构的 H100 发布:80GB HBM3、3.35 TB/s 带宽、FP8 精度,规格直指 GPT-4 这一级别的训练。同年 11 月,ChatGPT 发布。接下来的故事尽人皆知:全世界的云厂商都在抢 H100,英伟达的市值从 2024 年起登上全球之巅。10

6 2022–2026:从卖卡到卖机房

2024 年的 GB200 NVL72 定义了一种新形态:72 张 Blackwell 通过 NVSwitch 组成一个整柜“超级 GPU”,对外就是一台机器。11 2025 年,Blackwell Ultra(B300)把单卡显存推到 288GB。12 2026 年,下一代 Vera Rubin 已在 CES 上宣布全面投产。13

伴随硬件的还有故事的另一半:市值。2024 年英伟达一度成为全球市值最高的公司,2025 年率先突破 4 万亿美元,到 2026 年,市场讨论的焦点已经变成“谁先到 10 万亿美元”以及随之而来的泡沫之争。14

而在“机房”的另一端,Jetson Thor 代表的边缘算力同样在生长:通用机器人需要把推理放到现场,而不是每次请求都绕道云端。从云端巨兽到终端大脑,英伟达的产品版图已经覆盖了“算力产生、传输、消费”的整条链路。

7 竞争对手:AMD、英特尔,和“自己造芯片的人”

7.1 AMD:从千年老二到正面挑战者

AMD 在 2006 年收购 ATI 获得显卡业务,此后与英伟达在游戏市场拉锯了十几年,始终是“性能相近、价格更低、生态吃亏”的千年老二。转折发生在 AI 时代:Instinct MI250X(2021)支撑了当时世界最强的超算 Frontier;MI300X(2023)以 192GB HBM3 单卡内存直追数据中心卡规格;152025 年的 MI355X 与 2026 年的 MI400/Helios 整柜,目标直指与 Vera Rubin NVL72 一档。16 17

AMD 的软肋从来不是硬件,而是软件:CUDA 积累了近二十年,而 ROCm 的兼容层与工具链至今仍在追赶。不过差距在收窄——2026 年,AMD 与 OpenAI 宣布展开覆盖全栈的深度合作,这是此前难以想象的局面。18

7.2 英特尔:输掉的那十年

英特尔在 AI 加速卡上的经历堪称反面教材。2007 年启动的 Larrabee 想用 x86 核堆出一块通用显卡,结果在工程量级与软件适配的双重压力下流产;随后 Xeon Phi 昙花一现;2019 年收购 Habana Labs 得到 Gaudi 训练芯片;2022 年 Arc 消费显卡与 Ponte Vecchio 超算卡姗姗来迟,市场存在感始终有限。2025 年,英特尔宣布放弃大肆宣传的 Falcon Shores 大芯片,2026 年把全部筹码押到机架级 Jaguar Shores 上——业界普遍认为,这将是英特尔的最后机会。19

7.3 “自己造芯片的人”

还有一类竞争对手不那么出名,却被英伟达视为长期威胁:云厂商的自研芯片。谷歌 TPU(2015 年起内部部署)、亚马逊 Trainium/Inferentia、Meta MTIA、微软 Maia——自研的动机很朴素:成本可控、供给自主、针对自家负载优化。代价是通用性差、迭代慢。英伟达的应对是向“系统”延伸:把网络、交换、机柜一起卖,让自研者难以在“生态便利”上匹敌。20

此外还有一个无法回避的变量:出口管制。A100、H100 及其继任者被限制向中国出口,客观上催生了华为昇腾等国产算力生态,世界正在形成两个并行演进的算力市场。

7.4 竞争的实质

把各方放到一起看,竞争的维度早已不是“谁的芯片大”。桌面、机房、终端、网络、软件、产能、能源——这是一场全栈竞赛,而英伟达的领先,多半要归功于它同时对“芯片、互联、软件、系统”四个层面下了注。

8 展望:算力的下一站

站在 2026 年回望,可以预期四条主线:

  • 推理成本取代训练成本成为主战场。 模型训练一次花费巨大,但推理是每时每刻都在花钱的。未来竞争的核心是“每一百万 Token 的价格”,低精度专用推理芯片与集群调度优化的价值将凸显。
  • 边缘与云的分工更加清晰。 云端训练、混合部署推理、终端常驻小模型——Jetson Thor 这类边缘算力将与数据中心形成互补,而非替代关系。
  • 能源成为新的天花板。 一个 GB200 机柜的功耗已达上百千瓦,液冷成为标配。算力竞赛的物理上限正在逼近,效率曲线决定下一轮定价权,未来数据中心的位置很可能取决于“哪里有电”。
  • 软件开放的呼声渐起。 谷歌、AMD 等推动的 UALink 等开放互联标准,以及业界对单一 CUDA 依赖的警惕,都在给封闭生态施压。但二十余年积累的开发者惯性,短期难被撼动。

至于更远的问题——“专用 AI 芯片会不会终结 GPU”“推理会不会便宜到完全不值得自建”——答案都取决于同一件事:谁能在“更少的电力里算出更多的智能”。英伟达过去三十年的每一次赌注,本质上都在提前回答这个问题。

9 写在最后

从濒临倒闭的三人工作室,到如今 AI 基建的代名词,英伟达的历史可以被浓缩成这样一句话:它总是去解决当时最贵的问题——先是“怎样把 3D 游戏画出来”,再是“怎样让显卡算科学家要算的东西”,然后是“怎样让一万张卡像一块卡那样工作”,最后是“怎样把一整间机房变成一台机器”。

理解这条脉络之后,再回看今天琳琅满目的显卡型号,从游戏卡、Jetson 到数据中心卡,每一档位都对应着一个真实的需求层次。具体的“什么卡能部署什么模型”,可以参考同栏目另一篇《看懂英伟达显卡:从 4060 到 H100,一张卡能跑什么模型》

参考资料

著录格式参考 GB/T 7714 电子资源条目:[责任者]. 题名[EB/OL]. 发布年份[访问日期]. 网址. 所引内容。


  1. NVIDIA. NVIDIA Company History: Innovations Over the Years[EB/OL]. [2026-08-29]. https://www.nvidia.com/en-us/about-nvidia/corporate-timeline/. 公司年表按年份记载 RIVA 128、GeForce 256、上市、收购 3dfx、CUDA 等节点,为本文年份线索的官方口径。 

  2. GeForce 256 — The World's First GPU[EB/OL]. Wikipedia. 1999[2026-08-29]. https://en.wikipedia.org/wiki/GeForce_256. 记载 1999 年 GeForce 256 发布时以“世界首款 GPU”宣传,并独立完成几何变换与光照(T&L)。 

  3. NVIDIA. About CUDA[EB/OL]. 2006[2026-08-29]. https://developer.nvidia.com/about-cuda. 将 CUDA 定义为通用并行计算平台与编程模型,支持用 C 语言在 GPU 上编写通用程序。 

  4. Krizhevsky A., Sutskever I., Hinton G. E. ImageNet Classification with Deep Convolutional Neural Networks[EB/OL]. NeurIPS 2012. 2012[2026-08-29]. https://papers.nips.cc/paper_files/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html. 论文载明 ImageNet 2012 竞赛 top-5 错误率 15.3%(前届约 26%),训练使用两块 GTX 580 3GB 显卡。 

  5. WCCFTech. NVIDIA Unveils Pascal Tesla P100 With Over 20 TFLOPS of FP16 Performance[EB/OL]. 2016[2026-08-29]. https://wccftech.com/nvidia-pascal-gpu-gtc-2016/. 列明 P100(GP100)采用 16nm FinFET 与 HBM2,并首次引入 NVLink GPU 直连。 

  6. Top500. NVIDIA Delivers DGX-1 Supercomputer in a Box to OpenAI[EB/OL]. 2016[2026-08-29]. https://www.top500.org/news/nvidia-delivers-dgx-1-supercomputer-in-a-box-to-openai/. 记载 2016 年首台 DGX-1(8×P100 整机,发布售价 12.9 万美元)交付 OpenAI。 

  7. NVIDIA. NVIDIA V100[EB/OL]. 2017[2026-08-29]. https://www.nvidia.com/en-us/data-center/v100/. “Tensor Cores”一节说明 V100 为深度学习训练引入矩阵乘加专用硬件,吞吐数倍于普通 FP16 核心。 

  8. NVIDIA Blog. NVIDIA Jetson Thor Unlocks Real-Time Reasoning for General Robotics and Physical AI[EB/OL]. 2025[2026-08-29]. https://blogs.nvidia.com/blog/jetson-thor-physical-ai-edge/. 说明 Jetson Thor 基于 Blackwell 架构,面向通用机器人与物理 AI 的实时推理。 

  9. NVIDIA. NVIDIA A100 Tensor Core GPU[EB/OL]. 2020[2026-08-29]. https://www.nvidia.com/en-us/data-center/a100/. 载明 MIG 弹性切分(单卡最多 7 个独立实例)与 HBM2e 显存规格。 

  10. NVIDIA. NVIDIA H100 Tensor Core GPU[EB/OL]. 2022[2026-08-29]. https://www.nvidia.com/en-us/data-center/h100/. 规格表载明 80GB HBM3、3.35 TB/s 带宽,支持 FP8。 

  11. NVIDIA. NVIDIA Blackwell Data Center[EB/OL]. 2024[2026-08-29]. https://www.nvidia.com/en-us/data-center/blackwell/. GB200 NVL72 一节说明 72 张 Blackwell GPU 经 NVSwitch 全互联,可作单一 GPU 使用。 

  12. WCCFTech. NVIDIA Blackwell Ultra “B300” Unleashing In 2H 2025 — 1.1 Exaflops of FP4 Compute, 288 GB HBM3e[EB/OL]. 2025[2026-08-29]. https://wccftech.com/nvidia-blackwell-ultra-b300-2h-2025-1-1-exaflops-fp4-ai-288-gb-hbm3e-memory-50-percent-faster-than-gb200/. 载明 B300 配备 288GB HBM3e,2025 年下半年推出。 

  13. introl. NVIDIA Rubin Enters Full Production[EB/OL]. 2026[2026-08-29]. https://introl.com/blog/nvidia-rubin-full-production-ces-2026-ai-infrastructure. 标题即主张:Vera Rubin 全面投产,2026 年 CES 期间披露。 

  14. Nasdaq. The Race to $10 Trillion: Nvidia vs. Alphabet[EB/OL]. 2026[2026-08-29]. https://www.nasdaq.com/articles/race-10-trillion-nvidia-vs-alphabet. 讨论英伟达与 Alphabet 争夺十万亿美元市值的竞赛,回顾 2024 年登顶与 2025 年率先突破 4 万亿美元。 

  15. AMD. AMD Instinct MI300X Accelerators[EB/OL]. 2023[2026-08-29]. https://www.amd.com/en/products/accelerators/instinct/mi300/mi300x.html. 官方产品页注明 MI300X 配备 192GB HBM3 显存。 

  16. Guru3D. AMD Instinct MI400 GPUs Target Frontier AI and FP64 HPC[EB/OL]. 2026[2026-08-29]. https://www.guru3d.com/story/422d25a541d3ebc4cc4a513c44e496172ceec25a/. 列明 MI400 与 MI355X 为新一代 Instinct 加速卡,面向前沿 AI 与 FP64 HPC。 

  17. Futurum Group. AMD Helios Reaches Parity with Vera Rubin NVL72: Can Open Standards Outflank NVIDIA?[EB/OL]. 2026[2026-08-29]. https://futurumgroup.com/insights/amd-helios-reaches-parity-with-vera-rubin-nvl72-can-open-standards-outflank-nvidia/. 标题即主张:Helios 整柜与 Vera Rubin NVL72 同级。 

  18. AMD Newsroom. AMD and OpenAI: Collaborating Across Every Layer of the Stack[EB/OL]. 2026[2026-08-29]. https://newsroom.amd.com/news/aai-2026-openai-update/. 标题即主张:AMD 与 OpenAI 的全栈深度合作。 

  19. XFastest. Intel 放弃大肆宣传的 Falcon Shores AI GPU,将重点转向 Jaguar Shores[EB/OL]. 2026[2026-08-29]. https://www.xfastest.com/thread-296799-1-105.html. 标题即主张:放弃 Falcon Shores 大芯片,转投机架级 Jaguar Shores。 

  20. Google Cloud. Cloud TPU[EB/OL]. [2026-08-29]. https://cloud.google.com/tpu. 说明 TPU 自 2015 年起部署于其数据中心,用于深度学习的训练与推理。