跳转至

看懂英伟达显卡:从 4060 到 H100,一张卡能跑什么模型

初次接触英伟达显卡型号的人,大概都有过类似的困惑:4090、5090、6000、A100、H100……这些型号究竟是什么意思?到底有什么不同?该怎么选?

这些型号其实分属英伟达的三条产品线:面向游戏玩家的、面向工作站的专业卡,以及面向数据中心的加速卡。

本文旨在讲清这三条线的分工、型号命名的规则,以及:以手中现有的显卡,究竟能部署多大的模型。

适用读者

本文面向希望快速建立认知的读者:AI 应用开发者、本地部署爱好者,或者只想弄清楚“该买哪张卡”的普通用户。阅读不需要任何机器学习基础。

1 显卡为什么成了 AI 的主角

GPU之所以这么重要,靠的是通过矩阵运算加快计算速度。

CPU 像一支人数不多但全能的小队,什么任务都能处理;显卡则是一支规模庞大的流水线——每个单元只做“相乘再相加”,虽然单一,但能够同时处理海量的同类计算。而很巧的是,神经网络从训练到推理,绝大部分计算恰好就是这样的矩阵乘法。

变化始于 2018 年:图灵(Turing)架构开始,英伟达在游戏卡中也加入了张量核心(Tensor Core),专门加速矩阵运算。所以今天任何一张游戏卡都能运行大模型——这并非巧合,而是英伟达当年就有意为之的布局。

值得一提的是,RTX 5090、RTX PRO 6000 Blackwell 乃至部分数据中心卡,芯片本质上属于同一代架构。这些不同的硬件的真正的差异来自显存、互联、供电与驱动定位这些外围配置。

2 显卡的“铁人三项”:显存、带宽、算力

不必过分在意评测网站上的跑分数据。若要在本地运行模型,应先关注三项参数,建议的判断顺序是:显存容量 > 显存带宽 > 算力。

指标 比喻 决定什么 常见单位
显存容量 仓库大小 模型装不装得下 GB
显存带宽 传送带速度 生成速度(tokens/s) GB/s
算力 搬砖工人数 计算能有多快,训练更看重它 TFLOPS / TOPS

2.1 显存容量:第一道硬门槛

推理时,模型权重必须完整驻留在显存中。一旦装不下,系统只能将部分权重转移到系统内存(Offload),生成速度随即大幅下降。因此显存容量是硬性约束,算力再强也无法弥补容量的不足。

2.2 显存带宽:决定生成速度

大模型逐 Token 生成,每生成一个 Token 都要将全部权重从显存中重新读取。据此可以粗略估算单卡推理速度:

理论速度 (tokens/s) ≈ 显存带宽 ÷ 模型权重大小

以 RTX 4090 为例:带宽约 1.0 TB/s,运行 8B 模型的 4-bit 量化版(权重约 5GB),理论上限约 200 tokens/s,实际约为理论值的一半。同一模型改用 H200(4.8 TB/s)后,速度可提升近 5 倍——推理快慢主要取决于显存带宽,而非宣传中常见的算力数字。1

2.3 算力:训练阶段才真正重要

算力决定“乘加运算能算多快”,微调与训练更依赖它。值得注意的是,RTX 4090 的 FP16 算力(约 330 TFLOPS)甚至略高于 A100 80GB(约 312 TFLOPS)——那么 A100 的价值从何而来?下文会详细说明。2

算力不等于全部:“4090 吊打 A100”的误读

算力恰恰是 A100 最不值一提的优点。它真正的价值在于 80GB HBM 显存、2 TB/s 带宽、NVLink 互联与 ECC。这些才是数据中心卡的根基。

3 英伟达的三种生意

英伟达有三条产品线:面向玩家的 GeForce、面向工作站的 RTX PRO、面向数据中心的加速卡。

flowchart LR
  subgraph gc["GeForce 游戏卡(消费级)"]
    A["RTX 4060 · 8GB"]
    B["RTX 5070 · 12GB"]
    C["RTX 5090 · 32GB"]
  end
  subgraph wp["RTX PRO 专业卡(工作站)"]
    D["RTX PRO 4000/5000 中端"]
    E["RTX 6000 Ada · 48GB"]
    F["RTX PRO 6000 Blackwell · 96GB"]
  end
  subgraph dc["数据中心加速卡(训练/云服务)"]
    G["A100 · 80GB"]
    H["H100/H200 · 80/141GB"]
    I["B200/B300 · 192/288GB"]
  end
GeForce RTX PRO 数据中心加速卡
典型用户 玩家、个人本地部署 工作站、中小企业、商用部署 云厂商、训练集群
显存 GDDR,8–32GB GDDR,16–96GB HBM,40–288GB
显存带宽 0.27–1.79 TB/s 0.6–1.9 TB/s 1.2–8 TB/s
互联 仅 PCIe(无 NVLink) PCIe,部分支持 NVLink 桥接 NVLink/NVSwitch,可整柜组网
单卡价格 约 ¥2 千–1.7 万 约 ¥3 万–8 万 约 ¥6 万起,旗舰可超 ¥20 万
显示输出 有 有 无(纯计算卡)
ECC / vGPU / 认证驱动 无 有 有

价格说明

按 2026 年国内市场行情估算,波动较大,仅用于感知不同产品线的量级差异。

3.1 GeForce:性价比最高的 AI 卡

游戏卡的核心优势在于价格。RTX 5090 提供了 32GB 显存与 1.79 TB/s 带宽,足以支撑本地聊天、生图与 LoRA 微调等常见场景。3 局限同样明显:没有 ECC、没有 NVLink(RTX 40/50 系均无),驱动面向游戏优化。

还需提醒一点:英伟达的 GeForce 驱动许可不允许将游戏卡大规模部署在数据中心。个人自用没有问题,商用则应使用专业或数据中心产品线。

3.2 RTX PRO:面向工作站的“认证”卡

RTX PRO 与游戏卡芯片同源,定位却是专业应用:显存可达 96GB,支持 ECC,驱动经过 ISV 认证(CAD、建模、渲染等软件兼容性更有保障),并可通过 vGPU 拆分多租户使用。

适合三类需求:商用交付、单卡全速运行 70B 量化模型、以及不愿在驱动稳定性上投入精力的工作室。代表型号为 RTX 6000 Ada(48GB)与 RTX PRO 6000 Blackwell(96GB)。4 5

3.3 数据中心卡:云厂商的核心基础设施

这类卡没有显示接口、没有独立风扇(SXM 版依靠服务器风道),采用高带宽 HBM 显存,并配备 NVLink 高速互联,整柜显卡可协同计算。从 V100、A100、H100、H200 到 B200/B300,大模型训练几乎全部依赖它们。

普通用户与这类卡的交集,多半在于“租用”:云端按小时出租的 H100,正是它们。6

4 型号命名:字母标世代,数字定档位

4.1 数据中心卡:字母即架构

代号 架构(发布年) 显存 带宽 一句话定位
V100 Volta(2017) 32GB HBM2 0.9 TB/s 大模型训练时代的起点
A100 Ampere(2020) 40/80GB HBM2e 1.2/2.0 TB/s 经受住时间考验的经典款
H100 Hopper(2022) 80GB HBM3 3.35 TB/s 标杆:让 LLM 训练成为现实
H200 Hopper 换显存(2024) 141GB HBM3e 4.8 TB/s 大显存推理的主力
B200 Blackwell(2024/25) 192GB HBM3e 8.0 TB/s 新一代旗舰
B300 Blackwell Ultra(2025) 288GB HBM3e 8.0 TB/s 主打 FP4 推理
Rubin 下一代(2026 起量产) 更大 更快 2026 年开始出货,路线图仍在推进

此外还有一位服役多年的老将 T4(Turing,16GB GDDR6):2018 年以后云端常见的“便宜推理卡”,至今在不少 GPU 云上仍能见到。2 7 8

4.2 消费级:数字定档位,后缀看变体

GeForce RTX 50 系列延续了多年的规则:50 入门、60 主流、70 中坚、80 次旗舰、90 旗舰。后缀各有含义:

  • Ti / Super:加强版(如 5070 Ti、4080 Super);
  • D:中国特供版。以 RTX 5090D 为例,为符合出口管制削减了约两成多的 AI 算力(游戏性能基本不受影响),购买前应明确自身用途。9

4.3 专业级:看到 PRO 字样即切换到“专业逻辑”

RTX PRO 系列数字越大档位越高:4000/5000 为中端,6000 为旗舰。旧命名中的 “RTX 6000 Ada” 则是“世代名 + 档位”,Ada 即架构名称。看到 PRO、Ada、Hopper 这类字样,应理解为专业应用定位,与同代的游戏卡并非同一逻辑。

4.4 数据中心卡:后缀同样承载信息

  • SXM:服务器机架专用插槽,供电与互联更强;PCIe:通用插槽,兼容普通服务器,功耗略低;
  • NVL:带 NVLink 的版本(如 H200 NVL 141GB);
  • GB200:Grace CPU + Blackwell GPU 的组合整机;NVL72:72 张 Blackwell 通过 NVSwitch 组成的整柜超级计算机。

示例速览

  • RTX PRO 6000 Blackwell:专业线、旗舰档、Blackwell 世代 → 96GB 大显存,工作站顶配。
  • H200 NVL 141GB:Hopper 架构高代号、带 NVLink、141GB 显存 → 数据中心高端推理卡。
  • 掌握“产品线 + 世代 + 档位”这三点,新出的型号基本都能快速定位。

5 一算就懂:模型到底占用多少显存

部署模型的核心计算只有一条:

权重显存 ≈ 参数量 × 每参数字节数
FP16/BF16:2 字节/参数;INT8:1 字节;INT4(4-bit 量化):约 0.5–0.6 字节

算完之后还需为 KV 缓存与推理框架留出余量,建议在权重之外再预留 20%–40%。上下文越长,KV 缓存的占用越大,这一机制的细节在大语言模型概念速览中有更完整的说明。

常见模型的显存占用参考(约值):

模型(参数量) FP16 INT8 INT4(4-bit)
7–8B(Qwen2.5-7B、Llama-3-8B) ~16 GB ~8 GB ~5 GB
14B(Qwen2.5-14B) ~28 GB ~14 GB ~9 GB
32B(Qwen2.5-32B、DeepSeek-R1-Distill 32B) ~65 GB ~32 GB ~20 GB
70–72B(Llama-3-70B、Qwen2.5-72B) ~140 GB ~70 GB ~40 GB
671B MoE(DeepSeek-R1 / V3) ~1300 GB ~700 GB ~400 GB

为什么主流方案偏爱 4-bit 量化

70B 模型经 INT4 量化后,权重从 140GB 降至约 40GB,一张 48GB 的 RTX 6000 Ada 即可完整容纳。精度损失在多数任务中几乎不可察觉,本地部署最常用的 Ollama 默认即采用 4-bit 量化,日常使用完全足够。10

量化与推理的更多原理,可参考大语言模型概念速览;具体的部署步骤,建议阅读Ollama 部署本地大模型。

6 速查表:什么卡能跑什么模型

读表说明

按单卡估算,以主流开源大模型为例:FP16 表示全精度权重,Q4 表示 4-bit 量化。速度反映实际聊天体验,随量化方案、上下文长度与推理框架差异较大,仅供参考。

显存 代表显卡 能跑的模型 典型用途
8GB RTX 4060 / 5060 3B 全精度;7–8B Q4;SD 1.5 轻量聊天、语音转文字、个人 RAG
12GB RTX 4070 / 5070 3–4B 全精度;7–8B Q4 很舒服;14B Q4 勉强 日常聊天、SDXL 生图
16GB RTX 4080 Super / 5080 / 5070 Ti 7–8B FP16;14B Q4;32B Q4 放不下(需 Offload) 高质量聊天、代码助手、7B LoRA 微调
24GB RTX 3090 / 4090 14B FP16;32B Q4 可行;FLUX 全精度生图 本地全能:大模型 + 生图 + 小规模微调
32GB RTX 5090 32B Q4 全速;32B FP16 / 70B Q4 需 Offload 或多卡 个人顶配、视频生成入门
48GB RTX 6000 Ada 70B Q4 全速(约 44GB);32B INT8;14B 长上下文 商用单卡部署 70B 级模型
96GB RTX PRO 6000 Blackwell 70B INT8 全速;120B Q4;70B FP16 需 Offload 工作站顶配、单卡大模型全速
141GB H200 70B FP16 单卡全速 云上“大模型公寓”,多租户推理
192GB+ B200 / B300 超大模型单卡即可容纳,真正价值在集群 训练与大规模推理

6.1 24GB:一道值得注意的分水岭

32B 模型的 Q4 量化(约 20GB)、FLUX 全精度生图、7B 模型的 LoRA 微调,恰好都落在 24GB 这条线上。这也是 3090/4090 一直被称为“国民卡”的原因——即便二手 RTX 3090,至今仍是许多人的选择。

6.2 70B 级别:真正的门槛

70B 模型即便 Q4 量化也需约 40GB,单卡至少 48GB 起步;全精度则需 140GB,对应 H200 或更大规格。两张 5090 通过 PCIe 组合运行 70B Q4 并非不可行,但通信会成为瓶颈,实际速度通常只有单卡的 1.5 倍上下——显存容量不能简单线性叠加。

6.3 DeepSeek-R1 这类 671B 模型:不必强求

DeepSeek-R1 / V3 是 671B 参数的 MoE 模型,4-bit 量化仍需约 400GB,官方推荐 8×H100 或 4×B200 级别的部署阵容。11 个人用户希望本地体验,可运行其 32B 蒸馏版本;全量版本建议直接调用 API,综合成本更低。

6.4 图像与视频模型:显存要求有所不同

  • SD 1.5(约 2GB)→ 8GB 即可运行;
  • SDXL(约 7GB)→ 建议 12GB 以上;
  • FLUX.1 dev(约 24GB FP16)→ 24GB 为宜,16GB 需 Offload;12
  • 视频模型(Wan 2.1 14B 等,约 28GB FP16)→ 建议 32GB 起步。

7 “4090 比 A100 强”为什么是错觉

7.1 单卡推理:游戏卡更具性价比

推理属于“内存密集”型任务,主要依赖单卡表现。同一款 14B 模型,A100 的带宽是 4090 的两倍,速度相应接近两倍,但价格高出数倍——就“每单位预算获得的性能”而言,4090/5090 反而占优。然而 A100 能够容纳 70B INT8(70GB),4090 连门都无法进入,差距正在于此。

7.2 训练:这是团队的比赛

训练需要“同步”:每次更新参数,所有显卡都必须汇总梯度,通信速度决定整体效率。NVLink 双向带宽约 900 GB/s(B200 更达 1.8 TB/s),而 PCIe 5.0 x16 仅约 64 GB/s——差距达一个数量级。RTX 40/50 系没有 NVLink,多卡训练只能受限于 PCIe,规模与效率都难以提升。这正是训练集群必须采用 A100/H100/B200 的原因:

  • HBM 显存的可靠性与 ECC 纠错;
  • NVLink/NVSwitch 高速互联;
  • vGPU 虚拟化、企业支持与认证驱动;
  • 服务器级的散热与功耗设计。

结论:个人微调,RTX 4090/5090 已足够;企业级训练,应选择数据中心产品线。

8 常见问题速答

问题 简要回答
4090 是不是比 A100 强? 单看 FP16 算力略胜;但显存(24 vs 80GB)、带宽(1.0 vs 2.0 TB/s)、互联与 ECC 均差一个量级。推理与训练场景 A100 更强,4090 的优势在于性价比。
一张 4090 能跑 DeepSeek-R1 吗? 不能。671B 的 MoE 模型,Q4 量化仍需约 400GB,官方推荐 8×H100 或 4×B200。普通用户使用 API 更合适。
8GB 显卡是不是“玩不了 AI”? 可以运行。7B 模型量化版聊天、语音识别、轻量生图都没有问题;不行的是 30B 以上的大模型与训练任务。
显存不够能借用内存吗? 可以(Offload),但速度可能降至十分之一以下,属于“能运行”而非“好用”。
游戏卡商用算违规吗? 个人自用没有问题;GeForce 驱动许可限制的是数据中心的大规模部署。商用交付建议选择 RTX PRO 或数据中心产品线。
两块 4060 等于一张 4090 吗? 不等于。多卡需要拆分模型且通信存在瓶颈,推理场景中“大显存单卡”通常优于“多卡组合”。
苹果 M 系列和 AMD 显卡呢? 苹果统一内存“容量大、带宽低”(最高 128GB,但带宽数百 GB/s),能运行大模型但速度有限;其他厂商显卡还需关注 CUDA 兼容性这一生态壁垒。

9 选购建议:按用途选择,而非按参数攀比

从实践来看,预算应优先投入显存,而不是追求跑分米数上的小幅领先。以下为常见用途的参考选择,具体可结合自身情况调整:

  • 只想本地聊天 + 轻度 RAG:16GB 档(RTX 5080 / 5070 Ti),性价比最高;
  • 想跑 32B、FLUX 生图、偶尔微调:32GB(RTX 5090)或 48GB(RTX 6000 Ada);
  • 想全速跑 70B Q4 / 做商用交付:RTX PRO 6000 Blackwell(96GB),一步到位;
  • 大规模训练 / AI 服务:不必急于购置硬件,可先按小时租用 H100(约 2–5 美元/小时)验证需求,再决定是否自建集群;
  • 一条原则:显存 > 带宽 > 算力。预算有限时,宁可选大显存的中端卡,也不要小显存的旗舰卡。

10 写在最后

上述内容可以归结为三点:

  • 三条产品线:GeForce(游戏/个人)、RTX PRO(工作站/商用)、数据中心加速卡(训练/云);
  • 两个线索:架构字母(V/A/H/B/R)标世代,数字标档位;
  • 一条算账方式:模型权重必须驻留显存,“参数量 × 每参数字节”即可估算出所需容量。

显卡只是“跑得动”的前提。若想搭建一个真正可用的 AI 应用,模型之外还涉及上下文工程、RAG、工具调用等系统性问题——这些内容在大语言模型概念速览中有完整的脉络梳理,建议一并阅读。

至于这些产品线为何如此分工、每代 GPU 当年要解决什么问题,背后是一段三十年的公司史——见同栏目另一篇《英伟达三十年:一张显卡如何长成 AI 的基础设施》。

参考资料

著录格式参考 GB/T 7714 电子资源条目:[责任者]. 题名[EB/OL]. 发布年份[访问日期]. 网址. 所引内容。


  1. NVIDIA. NVIDIA H200 Tensor Core GPU[EB/OL]. 2024[2026-08-29]. https://www.nvidia.com/en-us/data-center/h200/. 规格载明 141GB HBM3e、约 4.8 TB/s 带宽。 ↩

  2. NVIDIA. NVIDIA A100 Tensor Core GPU[EB/OL]. 2020[2026-08-29]. https://www.nvidia.com/en-us/data-center/a100/. 规格载明 80GB 版带宽约 2 TB/s、FP16 张量算力约 312 TFLOPS。 ↩↩

  3. NVIDIA. NVIDIA GeForce RTX 50 Series[EB/OL]. 2025[2026-08-29]. https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/. 载明 RTX 5090 为 32GB GDDR7、约 1.79 TB/s 带宽。 ↩

  4. NVIDIA. NVIDIA RTX PRO Series[EB/OL]. 2025[2026-08-29]. https://www.nvidia.com/en-us/design-visualization/rtx-pro/. 载明工作站专业卡定位:最高 96GB 显存、ECC 与 vGPU 等特性。 ↩

  5. 快科技. NVIDIA 发布 12 款 RTX PRO Blackwell 专业显卡[EB/OL]. 2025[2026-08-29]. https://m.mydrivers.com/newsview/1036685.html. 载明一次性推出 12 款新卡、旗舰 96GB 大显存。 ↩

  6. NVIDIA. NVIDIA H100 Tensor Core GPU[EB/OL]. 2022[2026-08-29]. https://www.nvidia.com/en-us/data-center/h100/. 规格表载明 80GB HBM3、3.35 TB/s 带宽。 ↩

  7. NVIDIA. NVIDIA Blackwell Data Center[EB/OL]. 2024[2026-08-29]. https://www.nvidia.com/en-us/data-center/blackwell/. 载明 B200 配备 192GB HBM3e、约 8 TB/s 带宽。 ↩

  8. Vast.ai. Everything You Need to Know About the NVIDIA Blackwell Ultra B300[EB/OL]. 2025[2026-08-29]. https://vast.ai/article/everything-you-need-to-know-about-the-nvidia-blackwell-ultra-b300. 详解 B300 的 288GB HBM3e 与 GB300 NVL72 规格。 ↩

  9. Tom's Hardware. Nvidia Cuts Down the China-Specific RTX 5090D's AI TOPS Performance by Almost 23 Percent to Meet US Export Guidelines[EB/OL]. 2025[2026-08-29]. https://www.tomshardware.com/pc-components/gpus/nvidia-cuts-down-the-china-specific-rtx-5090d-ai-tops-performance-by-almost-23-percent-to-meet-us-export-guidelines. 标题即主张:5090D 的 AI TOPS 削减约 23%。 ↩

  10. Ollama. Ollama Library[EB/OL]. [2026-08-29]. https://ollama.com/library. 列明各模型默认量化档位(主流为 4-bit)与模型体积。 ↩

  11. Unsloth. DeepSeek-R1-GGUF[EB/OL]. [2026-08-29]. https://huggingface.co/unsloth/DeepSeek-R1-GGUF. 列明 671B 模型各量化档位文件大小,Q4_K_M 约 404GB。 ↩

  12. Black Forest Labs. FLUX.1[EB/OL]. 2024[2026-08-29]. https://github.com/black-forest-labs/flux. 说明 FLUX.1 dev 版 FP16 权重约 24GB 及显存需求。 ↩