CPU/GPU 与大模型训练
AI 教程: CPU/GPU 与大模型训练
这是一份高浓缩资料:结构清晰、要点到位,涵盖 CPU/GPU 基础、张量与数值精度、CUDA 与 PyTorch 实操、硬件选型、常见问答与排错清单。
0. 速览(30 秒)
- CPU vs GPU:CPU 擅长通用/顺序处理;GPU 擅长大规模并行(矩阵/向量)。
- 大模型必备 GPU:训练/推理核心是矩阵乘和并行化,GPU 的高并发 + 高带宽显存恰好匹配。
- 张量与精度:一切数据 → 张量;精度(FP16/FP8)与量化(INT8/INT4)是速度/显存与效果之间的权衡。
- PyTorch 上卡口诀:
device = "cuda" if ...; model.to(device); data.to(device) - 选卡看显存:先显存,再带宽/算力;生产尽量用满血高质量模型或云端托管 API。
1. CPU 与 GPU:差异、场景与类比
1.1 一句话对比
| 维度 | CPU | GPU |
|---|---|---|
| 架构 | 少核、复杂控制流 | 海量小核、SIMT 并行 |
| 擅长 | 分支/系统任务/小规模计算 | 矩阵乘、卷积、注意力、图形渲染 |
| 任务模型 | 时间片轮转、低延迟切换 | 批处理&吞吐导向 |
| 典型用法 | 业务逻辑、调度、I/O | 训练/推理主算子(GEMM、Conv 等) |
1.2 形象类比
- CPU = 老专家:思考缜密、一次做一件事快切换。
- GPU = 千军万马:海量士兵同时干活,适合“同构小任务”的并行。
1.3 可选 Mermaid 图(CPU 执行 vs GPU 并行)
flowchart LR
subgraph CPU["CPU(顺序/少核)"]
A1[任务1-片段A] --> A2[任务2-片段B] --> A3[任务3-片段C]
end
subgraph GPU["GPU(并行/多核)"]
B1[元素1计算]:::p
B2[元素2计算]:::p
B3[元素3计算]:::p
B4[元素4计算]:::p
end
classDef p fill:#e9f5ff,stroke:#3b82f6,stroke-width:1px;
2. 张量(Tensor)、精度与量化(配例子)
2.1 张量分级
- 0D:标量
3.14 - 1D:向量
[1,2,3] - 2D:矩阵(如 3×3 表)
- 3D+:仍称张量(如
batch×channel×height×width)
图像例子:一批 32 张 224×224 RGB 图 → 32×3×224×224(或 N×H×W×C,视框架而定)。



