Tag: GPU
All the articles with the tag "GPU".
-
并行计算与并行编程:从串行到 AI Infra
从「计算是什么」出发,系统梳理并行计算的核心概念——IPC、延迟与吞吐、数据依赖与同步、Flynn 分类法(SISD/SIMD/MISD/MIMD),到大模型训练中的数据并行、模型并行、流水线并行、张量并行与三维并行,再到 SIMT/CUDA 与 Tile/Triton 两种并行抽象,建立对「为什么大模型要写 Kernel、为什么 GPU 能训练大模型」的直觉。
-
大模型算力计算指南:从训练到推理
系统梳理大模型训练与推理所需算力的计算方法,涵盖全量训练 FLOPs 估算(6PD 公式)、训练显存需求、GPU 利用率与训练时间换算、Chinchilla Scaling Laws、LoRA/QLoRA 微调算力与显存、推理算力(2P/token)、KV Cache 显存、Prefill/Decode 两阶段延迟、memory-bound 与 compute-bound 分析、推理优化技术,并配以 LLaMA-7B/70B 等实例计算。