Posts
All the articles I've posted.
-
从零训练大模型(十一):预训练你的基座模型
动手跑通 pretrain_base.py:亲手预训练一个基座(Base)模型,并学会读懂 loss 与困惑度曲线,判断训练是否健康。
-
从零训练大模型(十二):SFT 指令微调与掩码损失
SFT 指令微调:对话模板、只对“回答”部分计算损失的掩码推导,以及序列打包,让基座模型学会遵循指令。
-
从零训练大模型(十三):奖励模型与 Bradley-Terry 推导
奖励模型的完整推导:成对偏好数据、标量奖励头,以及 Bradley-Terry 损失——如何把“人类更喜欢哪个回答”变成一个可训练的打分器。
-
从零训练大模型(十四):DPO 直接偏好优化
DPO 直接偏好优化的完整目标函数推导:隐式奖励是什么,为什么它能绕开显式强化学习,直接用偏好数据对齐模型。
-
从零训练大模型(十五):PPO 完整推导
PPO 完整推导:策略梯度、actor-critic、GAE、裁剪目标与 KL 惩罚,一步步搭出 RLHF 里最经典的强化学习对齐算法。
-
从零训练大模型(十六):GRPO / RLVR 组相对优势
GRPO / RLVR 的组相对优势推导:可验证奖励、组内相对优势、去掉 critic,以及课程学习——面向数学推理的高效对齐方法。
-
从零训练大模型(十七):评估(GSM8K)与推理对话
动手评估与推理:用 GSM8K 衡量预训练、SFT、DPO/PPO 各阶段的效果,并和你自己训练出的 checkpoint 真实对话。
-
从零训练大模型(十八):跑通全链路与进阶路线
收尾篇:一键把预训练到 RLHF 的整条链路跑起来,梳理常见报错与排查思路,并给出继续深入的进阶学习路线。
-
具身智能:从大语言模型到世界模型
一篇 IEEE 综述的中文导读——具身智能如何从离身 AI 走向 AGI,LLM/MLLM 赋能语义推理与任务分解,世界模型提供物理一致的内部表示与未来预测,以及两者联合架构为何将成为下一代具身系统的主流。
-
Yazi 终端文件管理器快捷键速查表
Yazi 是基于 Rust 的高性能终端文件管理器,快捷键大量沿用 Vim 逻辑。本文用一屏速查表 + 分类详解的形式,整理覆盖 90% 日常场景的核心指令。
-
LLM 应用实战精通:系列总览
一段 10 周的 LLM 实战之旅。本系列系统讲解大语言模型从基础概念、提示工程、微调、RAG,到评估、应用构建、部署、挑战与前沿趋势的全流程,帮你把散落的知识拼成完整图景。
-
LLM 应用实战精通(一):LLM 基础与真实世界用例
从 AI/ML/神经网络的历史脉络讲起,厘清 LLM 的规模与训练方式,盘点内容生成、翻译、摘要、问答等真实世界用例,并梳理数据、伦理、技术与部署四类挑战。
-
LLM 应用实战精通(二):领域与任务自适应方法
通用大模型在垂直领域为何力不从心?本文对比领域预训练、领域微调与检索增强生成(RAG)三类自适应方法,结合 BloombergGPT、ChatDoctor 等案例,讲清各自的适用场景与取舍。
-
LLM 应用实战精通(三):提示工程
系统梳理提示工程的核心技巧——从零样本/少样本提示,到思维链(CoT)、ReAct、自洽性等进阶方法,并总结写出高质量 Prompt 的实用原则。
-
LLM 应用实战精通(四):微调大模型
讲清什么时候该微调、怎么微调大模型:从全量微调到参数高效微调(PEFT/LoRA),再到指令微调与 RLHF,并梳理数据准备与训练流程的关键要点。
-
LLM 应用实战精通(五):检索增强生成 RAG
深入拆解 RAG 的完整管线——文档摄取、分块与嵌入、向量检索、上下文增强与生成,讲清每个环节的设计要点与常见优化手段。
-
LLM 应用实战精通(六):构建 LLM 应用的工具生态
盘点搭建 LLM 应用所需的工具生态——编排框架(LangChain/LlamaIndex)、向量数据库、模型托管与前端原型工具,理清各类组件在技术栈中的位置。
-
LLM 应用实战精通(七):LLM 评估技术
如何科学评估 LLM 与 LLM 应用?本文梳理从传统指标(BLEU/ROUGE/困惑度)到基准测试(MMLU/HELM),再到 LLM-as-a-judge 的评估方法体系与实践要点。
-
LLM 应用实战精通(八):动手构建你的 LLM 应用
把前几篇的概念落到代码——本文带你端到端搭建一个 LLM 应用,串起数据准备、检索、提示编排与前端界面,理清从原型到可用产品的关键步骤。
-
LLM 应用实战精通(九):高级特性与部署
从原型走向生产:本文介绍函数调用、Agent、缓存与量化等高级特性,并梳理把 LLM 应用部署上线时在性能、成本与可靠性上需要权衡的关键问题。