Aidenz
RSS Feed
我是aidenz,一名专注于人工智能系统与工程落地的开发者。
当前主要研究方向包括数据挖掘、深度学习、大模型和智能体。
在这里,我会持续记录从算法设计到系统实现的全过程,分享真实的工程经验、踩坑总结与技术思考。
希望这些内容不仅对研究者有价值,也能为工程实践提供参考。
🚀 关注领域:AI工程 / 大模型训练 / 智能体 / 高性能计算
✍️ 持续输出:技术博客 + 项目实践 + 方法论总结
Featured
-
并行计算与并行编程:从串行到 AI Infra
从「计算是什么」出发,系统梳理并行计算的核心概念——IPC、延迟与吞吐、数据依赖与同步、Flynn 分类法(SISD/SIMD/MISD/MIMD),到大模型训练中的数据并行、模型并行、流水线并行、张量并行与三维并行,再到 SIMT/CUDA 与 Tile/Triton 两种并行抽象,建立对「为什么大模型要写 Kernel、为什么 GPU 能训练大模型」的直觉。
-
大模型算力计算指南:从训练到推理
系统梳理大模型训练与推理所需算力的计算方法,涵盖全量训练 FLOPs 估算(6PD 公式)、训练显存需求、GPU 利用率与训练时间换算、Chinchilla Scaling Laws、LoRA/QLoRA 微调算力与显存、推理算力(2P/token)、KV Cache 显存、Prefill/Decode 两阶段延迟、memory-bound 与 compute-bound 分析、推理优化技术,并配以 LLaMA-7B/70B 等实例计算。
-
DoRA:权重分解低秩适应
DoRA(Weight-Decomposed Low-Rank Adaptation)通过将预训练权重分解为方向和幅度两个分量分别微调,在不增加推理开销的前提下缩小了 LoRA 与全量微调的性能差距,在常识推理、视觉指令微调、图像/视频文本理解等多种任务上持续超越 LoRA。
-
从零训练大模型(序):课程总览
一门完全零基础的中文系列教程:以 train-llm-from-scratch 仓库为“活教材”,用纯 PyTorch 手写复刻现代大模型的完整训练链路——从张量、Transformer、注意力,一路到预训练、SFT、奖励模型、DPO、PPO、GRPO。本文是 19 章的学习地图与阅读约定。
-
具身智能:从大语言模型到世界模型
一篇 IEEE 综述的中文导读——具身智能如何从离身 AI 走向 AGI,LLM/MLLM 赋能语义推理与任务分解,世界模型提供物理一致的内部表示与未来预测,以及两者联合架构为何将成为下一代具身系统的主流。
-
LLM 应用实战精通:系列总览
一段 10 周的 LLM 实战之旅。本系列系统讲解大语言模型从基础概念、提示工程、微调、RAG,到评估、应用构建、部署、挑战与前沿趋势的全流程,帮你把散落的知识拼成完整图景。
-
React 入门完全指南 - 从零开始构建现代 UI
基于实际项目,系统介绍 React 核心概念,包括组件、Props、useState、事件处理、表单、条件渲染、列表渲染等基础知识,适合零基础初学者。
-
Agent高级知识拓展
Agent 高级知识拓展、记忆与检索、上下文工程
-
agent经典范式
Agent经典范式构建
-
NLP基础知识
NLP基础知识
-
RAG概念
RAG基本概念
-
Git 常用命令完全指南 - 从入门到进阶
系统整理 Git 常用命令,从基础配置、提交与分支,到高级的 HEAD 操作、相对引用和撤销变更,适合初学者和日常查阅。
Recent Posts
-
LLM 算法 LeetCode(四):KV Cache 状态与生命周期
PagedAttention 管"内存怎么分配"(物理层),RadixAttention 管"哪些缓存内容能被跨请求复用"(逻辑层)。两者互补,RadixAttention 实际构建在分页式 KV 分配之上。
-
LLM 算法 LeetCode(三):单请求 Decode 与生成策略
从 KV Cache 的近似账本公式出发,厘清为何它随序列长度线性而非平方增长,再梳理 KV 压力的八类优化手段、Greedy / Temperature / Top-k / Top-p 四种采样策略,以及投机解码中草稿模型与目标模型的分工。
-
LLM 算法 LeetCode(二):Prefill 与 Attention Kernel
FlashAttention 不改 attention 的计算复杂度,而是用 IO-aware 的分块 + 在线 softmax,把 N×N 中间矩阵从显存流量中拿掉,实现精确而非近似的加速。
-
LLM 算法 LeetCode(一):请求结构与推理指标
从 Attention 与 Transformer 的关系出发,梳理 MHA / MQA / GQA / MLA 的 KV cache 演进主线,并拆解一次推理请求的 Prefill / Decode 两阶段与 TTFT / TPOT 两大延迟指标。
-
ICML 2026 最值得推荐的 AI Infra 论文:从 GPU 训练、LLM Serving 到 Agent Infra
用 GPU/Training System、LLM Serving 和 Agent Infra 三条主线梳理 ICML 2026 的 AI Infra 趋势与 Insight,并从每个主题精选三篇论文做深入且简洁的解析。
-
Jcode 使用指南:最大化主动的编程 Agent
Jcode 是一个最大化主动 (maximally proactive) 的编程 Agent 与助手,开源在 GitHub。本文系统梳理 Jcode 的核心理念、工具体系、技能(Skills)生态与典型工作流,帮助开发者快速上手并发挥 Agent 的全部潜力。