Posts
All the articles I've posted.
-
并行计算与并行编程:从串行到 AI Infra
从「计算是什么」出发,系统梳理并行计算的核心概念——IPC、延迟与吞吐、数据依赖与同步、Flynn 分类法(SISD/SIMD/MISD/MIMD),到大模型训练中的数据并行、模型并行、流水线并行、张量并行与三维并行,再到 SIMT/CUDA 与 Tile/Triton 两种并行抽象,建立对「为什么大模型要写 Kernel、为什么 GPU 能训练大模型」的直觉。
-
大模型算力计算指南:从训练到推理
系统梳理大模型训练与推理所需算力的计算方法,涵盖全量训练 FLOPs 估算(6PD 公式)、训练显存需求、GPU 利用率与训练时间换算、Chinchilla Scaling Laws、LoRA/QLoRA 微调算力与显存、推理算力(2P/token)、KV Cache 显存、Prefill/Decode 两阶段延迟、memory-bound 与 compute-bound 分析、推理优化技术,并配以 LLaMA-7B/70B 等实例计算。
-
DoRA:权重分解低秩适应
DoRA(Weight-Decomposed Low-Rank Adaptation)通过将预训练权重分解为方向和幅度两个分量分别微调,在不增加推理开销的前提下缩小了 LoRA 与全量微调的性能差距,在常识推理、视觉指令微调、图像/视频文本理解等多种任务上持续超越 LoRA。
-
Jcode 使用指南:最大化主动的编程 Agent
Jcode 是一个最大化主动 (maximally proactive) 的编程 Agent 与助手,开源在 GitHub。本文系统梳理 Jcode 的核心理念、工具体系、技能(Skills)生态与典型工作流,帮助开发者快速上手并发挥 Agent 的全部潜力。
-
从零训练大模型(序):课程总览
一门完全零基础的中文系列教程:以 train-llm-from-scratch 仓库为“活教材”,用纯 PyTorch 手写复刻现代大模型的完整训练链路——从张量、Transformer、注意力,一路到预训练、SFT、奖励模型、DPO、PPO、GRPO。本文是 19 章的学习地图与阅读约定。
-
从零训练大模型(一):环境搭建与第一次运行
从零装好 Python 环境、把 train-llm-from-scratch 项目跑起来,认识它的目录结构与 smoke 小配置,完成你的第一次运行。
-
从零训练大模型(二):数学与机器学习最小基础
用最小够用的数学打好地基:向量、矩阵、张量,导数与梯度,概率与对数,并从直觉上讲清“训练”到底在做什么。
-
从零训练大模型(三):PyTorch 极简入门
PyTorch 极简入门:张量运算、自动求导、nn.Module,最后亲手写一个最小可跑的训练循环,把前两章的概念落到代码。
-
从零训练大模型(四):文本如何变成数字——分词与数据形状
文本如何变成数字:分词(tokenization)、token id、上下文窗口,以及送进模型的 (B, T) batch 形状与错位标签。
-
从零训练大模型(五):解码器 Transformer 骨架
拆开 decoder-only Transformer 的完整数据流:嵌入与位置编码、pre-norm 残差 Block、LayerNorm、MLP、logits,并学会用 12NC²+2VC 估算参数量。
-
从零训练大模型(六):注意力机制完整推导
打开注意力这个黑箱:从缩放点积注意力、因果掩码,一路推到多头注意力,讲清它为什么是让 token 互相“通信”的引擎,以及复杂度从何而来。
-
从零训练大模型(七):训练目标——交叉熵与困惑度
训练目标的完整推导:从最大似然到负对数似然再到交叉熵,讲清困惑度(perplexity)的含义,以及标签错位与掩码在实现中的细节。
-
从零训练大模型(八):优化与训练系统
训练系统全景:从梯度下降到 Adam、AdamW,学习率调度、梯度累积、混合精度与分布式数据并行(DDP),把“怎么把模型训得动、训得稳”讲透。
-
从零训练大模型(九):生成与采样
自回归生成的完整机制,以及贪心、温度、top-k、top-p 等采样策略的原理与取舍——同一个模型,如何生成出风格迥异的文本。
-
从零训练大模型(十):数据流水线——从 The Pile 到 HDF5
预训练的数据流水线:从 The Pile 下载、预处理,到把扁平 token 存成 HDF5,再到训练时的数据加载窗口——喂给模型的数据是怎么造出来的。
-
从零训练大模型(十一):预训练你的基座模型
动手跑通 pretrain_base.py:亲手预训练一个基座(Base)模型,并学会读懂 loss 与困惑度曲线,判断训练是否健康。
-
从零训练大模型(十二):SFT 指令微调与掩码损失
SFT 指令微调:对话模板、只对“回答”部分计算损失的掩码推导,以及序列打包,让基座模型学会遵循指令。
-
从零训练大模型(十三):奖励模型与 Bradley-Terry 推导
奖励模型的完整推导:成对偏好数据、标量奖励头,以及 Bradley-Terry 损失——如何把“人类更喜欢哪个回答”变成一个可训练的打分器。
-
从零训练大模型(十四):DPO 直接偏好优化
DPO 直接偏好优化的完整目标函数推导:隐式奖励是什么,为什么它能绕开显式强化学习,直接用偏好数据对齐模型。
-
从零训练大模型(十五):PPO 完整推导
PPO 完整推导:策略梯度、actor-critic、GAE、裁剪目标与 KL 惩罚,一步步搭出 RLHF 里最经典的强化学习对齐算法。