看懂英伟达显卡:从 4060 到 H100,一张卡能跑什么模型¶
初次接触英伟达显卡型号的人,大概都有过类似的困惑:4090、5090、6000、A100、H100……这些型号究竟是什么意思?到底有什么不同?该怎么选?
这些型号其实分属英伟达的三条产品线:面向游戏玩家的、面向工作站的专业卡,以及面向数据中心的加速卡。
本文旨在讲清这三条线的分工、型号命名的规则,以及:以手中现有的显卡,究竟能部署多大的模型。
适用读者
本文面向希望快速建立认知的读者:AI 应用开发者、本地部署爱好者,或者只想弄清楚“该买哪张卡”的普通用户。阅读不需要任何机器学习基础。
1 显卡为什么成了 AI 的主角¶
GPU之所以这么重要,靠的是通过矩阵运算加快计算速度。
CPU 像一支人数不多但全能的小队,什么任务都能处理;显卡则是一支规模庞大的流水线——每个单元只做“相乘再相加”,虽然单一,但能够同时处理海量的同类计算。而很巧的是,神经网络从训练到推理,绝大部分计算恰好就是这样的矩阵乘法。
变化始于 2018 年:图灵(Turing)架构开始,英伟达在游戏卡中也加入了张量核心(Tensor Core),专门加速矩阵运算。所以今天任何一张游戏卡都能运行大模型——这并非巧合,而是英伟达当年就有意为之的布局。
值得一提的是,RTX 5090、RTX PRO 6000 Blackwell 乃至部分数据中心卡,芯片本质上属于同一代架构。这些不同的硬件的真正的差异来自显存、互联、供电与驱动定位这些外围配置。
2 显卡的“铁人三项”:显存、带宽、算力¶
不必过分在意评测网站上的跑分数据。若要在本地运行模型,应先关注三项参数,建议的判断顺序是:显存容量 > 显存带宽 > 算力。
| 指标 | 比喻 | 决定什么 | 常见单位 |
|---|---|---|---|
| 显存容量 | 仓库大小 | 模型装不装得下 | GB |
| 显存带宽 | 传送带速度 | 生成速度(tokens/s) | GB/s |
| 算力 | 搬砖工人数 | 计算能有多快,训练更看重它 | TFLOPS / TOPS |
2.1 显存容量:第一道硬门槛¶
推理时,模型权重必须完整驻留在显存中。一旦装不下,系统只能将部分权重转移到系统内存(Offload),生成速度随即大幅下降。因此显存容量是硬性约束,算力再强也无法弥补容量的不足。
2.2 显存带宽:决定生成速度¶
大模型逐 Token 生成,每生成一个 Token 都要将全部权重从显存中重新读取。据此可以粗略估算单卡推理速度:
以 RTX 4090 为例:带宽约 1.0 TB/s,运行 8B 模型的 4-bit 量化版(权重约 5GB),理论上限约 200 tokens/s,实际约为理论值的一半。同一模型改用 H200(4.8 TB/s)后,速度可提升近 5 倍——推理快慢主要取决于显存带宽,而非宣传中常见的算力数字。1
2.3 算力:训练阶段才真正重要¶
算力决定“乘加运算能算多快”,微调与训练更依赖它。值得注意的是,RTX 4090 的 FP16 算力(约 330 TFLOPS)甚至略高于 A100 80GB(约 312 TFLOPS)——那么 A100 的价值从何而来?下文会详细说明。2
算力不等于全部:“4090 吊打 A100”的误读
算力恰恰是 A100 最不值一提的优点。它真正的价值在于 80GB HBM 显存、2 TB/s 带宽、NVLink 互联与 ECC。这些才是数据中心卡的根基。
3 英伟达的三种生意¶
英伟达有三条产品线:面向玩家的 GeForce、面向工作站的 RTX PRO、面向数据中心的加速卡。
flowchart LR
subgraph gc["GeForce 游戏卡(消费级)"]
A["RTX 4060 · 8GB"]
B["RTX 5070 · 12GB"]
C["RTX 5090 · 32GB"]
end
subgraph wp["RTX PRO 专业卡(工作站)"]
D["RTX PRO 4000/5000 中端"]
E["RTX 6000 Ada · 48GB"]
F["RTX PRO 6000 Blackwell · 96GB"]
end
subgraph dc["数据中心加速卡(训练/云服务)"]
G["A100 · 80GB"]
H["H100/H200 · 80/141GB"]
I["B200/B300 · 192/288GB"]
end
| GeForce | RTX PRO | 数据中心加速卡 | |
|---|---|---|---|
| 典型用户 | 玩家、个人本地部署 | 工作站、中小企业、商用部署 | 云厂商、训练集群 |
| 显存 | GDDR,8–32GB | GDDR,16–96GB | HBM,40–288GB |
| 显存带宽 | 0.27–1.79 TB/s | 0.6–1.9 TB/s | 1.2–8 TB/s |
| 互联 | 仅 PCIe(无 NVLink) | PCIe,部分支持 NVLink 桥接 | NVLink/NVSwitch,可整柜组网 |
| 单卡价格 | 约 ¥2 千–1.7 万 | 约 ¥3 万–8 万 | 约 ¥6 万起,旗舰可超 ¥20 万 |
| 显示输出 | 有 | 有 | 无(纯计算卡) |
| ECC / vGPU / 认证驱动 | 无 | 有 | 有 |
价格说明
按 2026 年国内市场行情估算,波动较大,仅用于感知不同产品线的量级差异。
3.1 GeForce:性价比最高的 AI 卡¶
游戏卡的核心优势在于价格。RTX 5090 提供了 32GB 显存与 1.79 TB/s 带宽,足以支撑本地聊天、生图与 LoRA 微调等常见场景。3 局限同样明显:没有 ECC、没有 NVLink(RTX 40/50 系均无),驱动面向游戏优化。
还需提醒一点:英伟达的 GeForce 驱动许可不允许将游戏卡大规模部署在数据中心。个人自用没有问题,商用则应使用专业或数据中心产品线。
3.2 RTX PRO:面向工作站的“认证”卡¶
RTX PRO 与游戏卡芯片同源,定位却是专业应用:显存可达 96GB,支持 ECC,驱动经过 ISV 认证(CAD、建模、渲染等软件兼容性更有保障),并可通过 vGPU 拆分多租户使用。
适合三类需求:商用交付、单卡全速运行 70B 量化模型、以及不愿在驱动稳定性上投入精力的工作室。代表型号为 RTX 6000 Ada(48GB)与 RTX PRO 6000 Blackwell(96GB)。4 5
3.3 数据中心卡:云厂商的核心基础设施¶
这类卡没有显示接口、没有独立风扇(SXM 版依靠服务器风道),采用高带宽 HBM 显存,并配备 NVLink 高速互联,整柜显卡可协同计算。从 V100、A100、H100、H200 到 B200/B300,大模型训练几乎全部依赖它们。
普通用户与这类卡的交集,多半在于“租用”:云端按小时出租的 H100,正是它们。6
4 型号命名:字母标世代,数字定档位¶
4.1 数据中心卡:字母即架构¶
| 代号 | 架构(发布年) | 显存 | 带宽 | 一句话定位 |
|---|---|---|---|---|
| V100 | Volta(2017) | 32GB HBM2 | 0.9 TB/s | 大模型训练时代的起点 |
| A100 | Ampere(2020) | 40/80GB HBM2e | 1.2/2.0 TB/s | 经受住时间考验的经典款 |
| H100 | Hopper(2022) | 80GB HBM3 | 3.35 TB/s | 标杆:让 LLM 训练成为现实 |
| H200 | Hopper 换显存(2024) | 141GB HBM3e | 4.8 TB/s | 大显存推理的主力 |
| B200 | Blackwell(2024/25) | 192GB HBM3e | 8.0 TB/s | 新一代旗舰 |
| B300 | Blackwell Ultra(2025) | 288GB HBM3e | 8.0 TB/s | 主打 FP4 推理 |
| Rubin | 下一代(2026 起量产) | 更大 | 更快 | 2026 年开始出货,路线图仍在推进 |
此外还有一位服役多年的老将 T4(Turing,16GB GDDR6):2018 年以后云端常见的“便宜推理卡”,至今在不少 GPU 云上仍能见到。2 7 8
4.2 消费级:数字定档位,后缀看变体¶
GeForce RTX 50 系列延续了多年的规则:50 入门、60 主流、70 中坚、80 次旗舰、90 旗舰。后缀各有含义:
Ti/Super:加强版(如 5070 Ti、4080 Super);D:中国特供版。以 RTX 5090D 为例,为符合出口管制削减了约两成多的 AI 算力(游戏性能基本不受影响),购买前应明确自身用途。9
4.3 专业级:看到 PRO 字样即切换到“专业逻辑”¶
RTX PRO 系列数字越大档位越高:4000/5000 为中端,6000 为旗舰。旧命名中的 “RTX 6000 Ada” 则是“世代名 + 档位”,Ada 即架构名称。看到 PRO、Ada、Hopper 这类字样,应理解为专业应用定位,与同代的游戏卡并非同一逻辑。
4.4 数据中心卡:后缀同样承载信息¶
SXM:服务器机架专用插槽,供电与互联更强;PCIe:通用插槽,兼容普通服务器,功耗略低;NVL:带 NVLink 的版本(如 H200 NVL 141GB);GB200:Grace CPU + Blackwell GPU 的组合整机;NVL72:72 张 Blackwell 通过 NVSwitch 组成的整柜超级计算机。
示例速览
RTX PRO 6000 Blackwell:专业线、旗舰档、Blackwell 世代 → 96GB 大显存,工作站顶配。H200 NVL 141GB:Hopper 架构高代号、带 NVLink、141GB 显存 → 数据中心高端推理卡。- 掌握“产品线 + 世代 + 档位”这三点,新出的型号基本都能快速定位。
5 一算就懂:模型到底占用多少显存¶
部署模型的核心计算只有一条:
算完之后还需为 KV 缓存与推理框架留出余量,建议在权重之外再预留 20%–40%。上下文越长,KV 缓存的占用越大,这一机制的细节在大语言模型概念速览中有更完整的说明。
常见模型的显存占用参考(约值):
| 模型(参数量) | FP16 | INT8 | INT4(4-bit) |
|---|---|---|---|
| 7–8B(Qwen2.5-7B、Llama-3-8B) | ~16 GB | ~8 GB | ~5 GB |
| 14B(Qwen2.5-14B) | ~28 GB | ~14 GB | ~9 GB |
| 32B(Qwen2.5-32B、DeepSeek-R1-Distill 32B) | ~65 GB | ~32 GB | ~20 GB |
| 70–72B(Llama-3-70B、Qwen2.5-72B) | ~140 GB | ~70 GB | ~40 GB |
| 671B MoE(DeepSeek-R1 / V3) | ~1300 GB | ~700 GB | ~400 GB |
为什么主流方案偏爱 4-bit 量化
70B 模型经 INT4 量化后,权重从 140GB 降至约 40GB,一张 48GB 的 RTX 6000 Ada 即可完整容纳。精度损失在多数任务中几乎不可察觉,本地部署最常用的 Ollama 默认即采用 4-bit 量化,日常使用完全足够。10
量化与推理的更多原理,可参考大语言模型概念速览;具体的部署步骤,建议阅读Ollama 部署本地大模型。
6 速查表:什么卡能跑什么模型¶
读表说明
按单卡估算,以主流开源大模型为例:FP16 表示全精度权重,Q4 表示 4-bit 量化。速度反映实际聊天体验,随量化方案、上下文长度与推理框架差异较大,仅供参考。
| 显存 | 代表显卡 | 能跑的模型 | 典型用途 |
|---|---|---|---|
| 8GB | RTX 4060 / 5060 | 3B 全精度;7–8B Q4;SD 1.5 | 轻量聊天、语音转文字、个人 RAG |
| 12GB | RTX 4070 / 5070 | 3–4B 全精度;7–8B Q4 很舒服;14B Q4 勉强 | 日常聊天、SDXL 生图 |
| 16GB | RTX 4080 Super / 5080 / 5070 Ti | 7–8B FP16;14B Q4;32B Q4 放不下(需 Offload) | 高质量聊天、代码助手、7B LoRA 微调 |
| 24GB | RTX 3090 / 4090 | 14B FP16;32B Q4 可行;FLUX 全精度生图 | 本地全能:大模型 + 生图 + 小规模微调 |
| 32GB | RTX 5090 | 32B Q4 全速;32B FP16 / 70B Q4 需 Offload 或多卡 | 个人顶配、视频生成入门 |
| 48GB | RTX 6000 Ada | 70B Q4 全速(约 44GB);32B INT8;14B 长上下文 | 商用单卡部署 70B 级模型 |
| 96GB | RTX PRO 6000 Blackwell | 70B INT8 全速;120B Q4;70B FP16 需 Offload | 工作站顶配、单卡大模型全速 |
| 141GB | H200 | 70B FP16 单卡全速 | 云上“大模型公寓”,多租户推理 |
| 192GB+ | B200 / B300 | 超大模型单卡即可容纳,真正价值在集群 | 训练与大规模推理 |
6.1 24GB:一道值得注意的分水岭¶
32B 模型的 Q4 量化(约 20GB)、FLUX 全精度生图、7B 模型的 LoRA 微调,恰好都落在 24GB 这条线上。这也是 3090/4090 一直被称为“国民卡”的原因——即便二手 RTX 3090,至今仍是许多人的选择。
6.2 70B 级别:真正的门槛¶
70B 模型即便 Q4 量化也需约 40GB,单卡至少 48GB 起步;全精度则需 140GB,对应 H200 或更大规格。两张 5090 通过 PCIe 组合运行 70B Q4 并非不可行,但通信会成为瓶颈,实际速度通常只有单卡的 1.5 倍上下——显存容量不能简单线性叠加。
6.3 DeepSeek-R1 这类 671B 模型:不必强求¶
DeepSeek-R1 / V3 是 671B 参数的 MoE 模型,4-bit 量化仍需约 400GB,官方推荐 8×H100 或 4×B200 级别的部署阵容。11 个人用户希望本地体验,可运行其 32B 蒸馏版本;全量版本建议直接调用 API,综合成本更低。
6.4 图像与视频模型:显存要求有所不同¶
- SD 1.5(约 2GB)→ 8GB 即可运行;
- SDXL(约 7GB)→ 建议 12GB 以上;
- FLUX.1 dev(约 24GB FP16)→ 24GB 为宜,16GB 需 Offload;12
- 视频模型(Wan 2.1 14B 等,约 28GB FP16)→ 建议 32GB 起步。
7 “4090 比 A100 强”为什么是错觉¶
7.1 单卡推理:游戏卡更具性价比¶
推理属于“内存密集”型任务,主要依赖单卡表现。同一款 14B 模型,A100 的带宽是 4090 的两倍,速度相应接近两倍,但价格高出数倍——就“每单位预算获得的性能”而言,4090/5090 反而占优。然而 A100 能够容纳 70B INT8(70GB),4090 连门都无法进入,差距正在于此。
7.2 训练:这是团队的比赛¶
训练需要“同步”:每次更新参数,所有显卡都必须汇总梯度,通信速度决定整体效率。NVLink 双向带宽约 900 GB/s(B200 更达 1.8 TB/s),而 PCIe 5.0 x16 仅约 64 GB/s——差距达一个数量级。RTX 40/50 系没有 NVLink,多卡训练只能受限于 PCIe,规模与效率都难以提升。这正是训练集群必须采用 A100/H100/B200 的原因:
- HBM 显存的可靠性与 ECC 纠错;
- NVLink/NVSwitch 高速互联;
- vGPU 虚拟化、企业支持与认证驱动;
- 服务器级的散热与功耗设计。
结论:个人微调,RTX 4090/5090 已足够;企业级训练,应选择数据中心产品线。
8 常见问题速答¶
| 问题 | 简要回答 |
|---|---|
| 4090 是不是比 A100 强? | 单看 FP16 算力略胜;但显存(24 vs 80GB)、带宽(1.0 vs 2.0 TB/s)、互联与 ECC 均差一个量级。推理与训练场景 A100 更强,4090 的优势在于性价比。 |
| 一张 4090 能跑 DeepSeek-R1 吗? | 不能。671B 的 MoE 模型,Q4 量化仍需约 400GB,官方推荐 8×H100 或 4×B200。普通用户使用 API 更合适。 |
| 8GB 显卡是不是“玩不了 AI”? | 可以运行。7B 模型量化版聊天、语音识别、轻量生图都没有问题;不行的是 30B 以上的大模型与训练任务。 |
| 显存不够能借用内存吗? | 可以(Offload),但速度可能降至十分之一以下,属于“能运行”而非“好用”。 |
| 游戏卡商用算违规吗? | 个人自用没有问题;GeForce 驱动许可限制的是数据中心的大规模部署。商用交付建议选择 RTX PRO 或数据中心产品线。 |
| 两块 4060 等于一张 4090 吗? | 不等于。多卡需要拆分模型且通信存在瓶颈,推理场景中“大显存单卡”通常优于“多卡组合”。 |
| 苹果 M 系列和 AMD 显卡呢? | 苹果统一内存“容量大、带宽低”(最高 128GB,但带宽数百 GB/s),能运行大模型但速度有限;其他厂商显卡还需关注 CUDA 兼容性这一生态壁垒。 |
9 选购建议:按用途选择,而非按参数攀比¶
从实践来看,预算应优先投入显存,而不是追求跑分米数上的小幅领先。以下为常见用途的参考选择,具体可结合自身情况调整:
- 只想本地聊天 + 轻度 RAG:16GB 档(RTX 5080 / 5070 Ti),性价比最高;
- 想跑 32B、FLUX 生图、偶尔微调:32GB(RTX 5090)或 48GB(RTX 6000 Ada);
- 想全速跑 70B Q4 / 做商用交付:RTX PRO 6000 Blackwell(96GB),一步到位;
- 大规模训练 / AI 服务:不必急于购置硬件,可先按小时租用 H100(约 2–5 美元/小时)验证需求,再决定是否自建集群;
- 一条原则:显存 > 带宽 > 算力。预算有限时,宁可选大显存的中端卡,也不要小显存的旗舰卡。
10 写在最后¶
上述内容可以归结为三点:
- 三条产品线:GeForce(游戏/个人)、RTX PRO(工作站/商用)、数据中心加速卡(训练/云);
- 两个线索:架构字母(V/A/H/B/R)标世代,数字标档位;
- 一条算账方式:模型权重必须驻留显存,“参数量 × 每参数字节”即可估算出所需容量。
显卡只是“跑得动”的前提。若想搭建一个真正可用的 AI 应用,模型之外还涉及上下文工程、RAG、工具调用等系统性问题——这些内容在大语言模型概念速览中有完整的脉络梳理,建议一并阅读。
至于这些产品线为何如此分工、每代 GPU 当年要解决什么问题,背后是一段三十年的公司史——见同栏目另一篇《英伟达三十年:一张显卡如何长成 AI 的基础设施》。
参考资料¶
著录格式参考 GB/T 7714 电子资源条目:[责任者]. 题名[EB/OL]. 发布年份[访问日期]. 网址. 所引内容。
-
NVIDIA. NVIDIA H200 Tensor Core GPU[EB/OL]. 2024[2026-08-29]. https://www.nvidia.com/en-us/data-center/h200/. 规格载明 141GB HBM3e、约 4.8 TB/s 带宽。 ↩
-
NVIDIA. NVIDIA A100 Tensor Core GPU[EB/OL]. 2020[2026-08-29]. https://www.nvidia.com/en-us/data-center/a100/. 规格载明 80GB 版带宽约 2 TB/s、FP16 张量算力约 312 TFLOPS。 ↩↩
-
NVIDIA. NVIDIA GeForce RTX 50 Series[EB/OL]. 2025[2026-08-29]. https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/. 载明 RTX 5090 为 32GB GDDR7、约 1.79 TB/s 带宽。 ↩
-
NVIDIA. NVIDIA RTX PRO Series[EB/OL]. 2025[2026-08-29]. https://www.nvidia.com/en-us/design-visualization/rtx-pro/. 载明工作站专业卡定位:最高 96GB 显存、ECC 与 vGPU 等特性。 ↩
-
快科技. NVIDIA 发布 12 款 RTX PRO Blackwell 专业显卡[EB/OL]. 2025[2026-08-29]. https://m.mydrivers.com/newsview/1036685.html. 载明一次性推出 12 款新卡、旗舰 96GB 大显存。 ↩
-
NVIDIA. NVIDIA H100 Tensor Core GPU[EB/OL]. 2022[2026-08-29]. https://www.nvidia.com/en-us/data-center/h100/. 规格表载明 80GB HBM3、3.35 TB/s 带宽。 ↩
-
NVIDIA. NVIDIA Blackwell Data Center[EB/OL]. 2024[2026-08-29]. https://www.nvidia.com/en-us/data-center/blackwell/. 载明 B200 配备 192GB HBM3e、约 8 TB/s 带宽。 ↩
-
Vast.ai. Everything You Need to Know About the NVIDIA Blackwell Ultra B300[EB/OL]. 2025[2026-08-29]. https://vast.ai/article/everything-you-need-to-know-about-the-nvidia-blackwell-ultra-b300. 详解 B300 的 288GB HBM3e 与 GB300 NVL72 规格。 ↩
-
Tom's Hardware. Nvidia Cuts Down the China-Specific RTX 5090D's AI TOPS Performance by Almost 23 Percent to Meet US Export Guidelines[EB/OL]. 2025[2026-08-29]. https://www.tomshardware.com/pc-components/gpus/nvidia-cuts-down-the-china-specific-rtx-5090d-ai-tops-performance-by-almost-23-percent-to-meet-us-export-guidelines. 标题即主张:5090D 的 AI TOPS 削减约 23%。 ↩
-
Ollama. Ollama Library[EB/OL]. [2026-08-29]. https://ollama.com/library. 列明各模型默认量化档位(主流为 4-bit)与模型体积。 ↩
-
Unsloth. DeepSeek-R1-GGUF[EB/OL]. [2026-08-29]. https://huggingface.co/unsloth/DeepSeek-R1-GGUF. 列明 671B 模型各量化档位文件大小,Q4_K_M 约 404GB。 ↩
-
Black Forest Labs. FLUX.1[EB/OL]. 2024[2026-08-29]. https://github.com/black-forest-labs/flux. 说明 FLUX.1 dev 版 FP16 权重约 24GB 及显存需求。 ↩
