Tag: LLM
All the articles with the tag "LLM".
-
大模型算力计算指南:从训练到推理
系统梳理大模型训练与推理所需算力的计算方法,涵盖全量训练 FLOPs 估算(6PD 公式)、训练显存需求、GPU 利用率与训练时间换算、Chinchilla Scaling Laws、LoRA/QLoRA 微调算力与显存、推理算力(2P/token)、KV Cache 显存、Prefill/Decode 两阶段延迟、memory-bound 与 compute-bound 分析、推理优化技术,并配以 LLaMA-7B/70B 等实例计算。
-
DoRA:权重分解低秩适应
DoRA(Weight-Decomposed Low-Rank Adaptation)通过将预训练权重分解为方向和幅度两个分量分别微调,在不增加推理开销的前提下缩小了 LoRA 与全量微调的性能差距,在常识推理、视觉指令微调、图像/视频文本理解等多种任务上持续超越 LoRA。
-
从零训练大模型(序):课程总览
一门完全零基础的中文系列教程:以 train-llm-from-scratch 仓库为“活教材”,用纯 PyTorch 手写复刻现代大模型的完整训练链路——从张量、Transformer、注意力,一路到预训练、SFT、奖励模型、DPO、PPO、GRPO。本文是 19 章的学习地图与阅读约定。
-
从零训练大模型(一):环境搭建与第一次运行
从零装好 Python 环境、把 train-llm-from-scratch 项目跑起来,认识它的目录结构与 smoke 小配置,完成你的第一次运行。
-
从零训练大模型(二):数学与机器学习最小基础
用最小够用的数学打好地基:向量、矩阵、张量,导数与梯度,概率与对数,并从直觉上讲清“训练”到底在做什么。
-
从零训练大模型(三):PyTorch 极简入门
PyTorch 极简入门:张量运算、自动求导、nn.Module,最后亲手写一个最小可跑的训练循环,把前两章的概念落到代码。
-
从零训练大模型(四):文本如何变成数字——分词与数据形状
文本如何变成数字:分词(tokenization)、token id、上下文窗口,以及送进模型的 (B, T) batch 形状与错位标签。
-
从零训练大模型(五):解码器 Transformer 骨架
拆开 decoder-only Transformer 的完整数据流:嵌入与位置编码、pre-norm 残差 Block、LayerNorm、MLP、logits,并学会用 12NC²+2VC 估算参数量。
-
从零训练大模型(六):注意力机制完整推导
打开注意力这个黑箱:从缩放点积注意力、因果掩码,一路推到多头注意力,讲清它为什么是让 token 互相“通信”的引擎,以及复杂度从何而来。
-
从零训练大模型(七):训练目标——交叉熵与困惑度
训练目标的完整推导:从最大似然到负对数似然再到交叉熵,讲清困惑度(perplexity)的含义,以及标签错位与掩码在实现中的细节。
-
从零训练大模型(八):优化与训练系统
训练系统全景:从梯度下降到 Adam、AdamW,学习率调度、梯度累积、混合精度与分布式数据并行(DDP),把“怎么把模型训得动、训得稳”讲透。
-
从零训练大模型(九):生成与采样
自回归生成的完整机制,以及贪心、温度、top-k、top-p 等采样策略的原理与取舍——同一个模型,如何生成出风格迥异的文本。
-
从零训练大模型(十):数据流水线——从 The Pile 到 HDF5
预训练的数据流水线:从 The Pile 下载、预处理,到把扁平 token 存成 HDF5,再到训练时的数据加载窗口——喂给模型的数据是怎么造出来的。
-
从零训练大模型(十一):预训练你的基座模型
动手跑通 pretrain_base.py:亲手预训练一个基座(Base)模型,并学会读懂 loss 与困惑度曲线,判断训练是否健康。
-
从零训练大模型(十二):SFT 指令微调与掩码损失
SFT 指令微调:对话模板、只对“回答”部分计算损失的掩码推导,以及序列打包,让基座模型学会遵循指令。
-
从零训练大模型(十三):奖励模型与 Bradley-Terry 推导
奖励模型的完整推导:成对偏好数据、标量奖励头,以及 Bradley-Terry 损失——如何把“人类更喜欢哪个回答”变成一个可训练的打分器。
-
从零训练大模型(十四):DPO 直接偏好优化
DPO 直接偏好优化的完整目标函数推导:隐式奖励是什么,为什么它能绕开显式强化学习,直接用偏好数据对齐模型。
-
从零训练大模型(十五):PPO 完整推导
PPO 完整推导:策略梯度、actor-critic、GAE、裁剪目标与 KL 惩罚,一步步搭出 RLHF 里最经典的强化学习对齐算法。
-
从零训练大模型(十六):GRPO / RLVR 组相对优势
GRPO / RLVR 的组相对优势推导:可验证奖励、组内相对优势、去掉 critic,以及课程学习——面向数学推理的高效对齐方法。
-
从零训练大模型(十七):评估(GSM8K)与推理对话
动手评估与推理:用 GSM8K 衡量预训练、SFT、DPO/PPO 各阶段的效果,并和你自己训练出的 checkpoint 真实对话。