Skip to main content

02 - 学习资源大全

转载说明

本页资源清单转载并整理自开源文档站 AI Infra 学习笔记,作者 程治玮(Se7en / cr7258),仅作个人学习存档,条目与描述保持原样。

原站按主题分成十个页面,这里合并为一页,用右侧目录跳转。学习路线与图解见 01 - 总览与学习路线

快速跳转

tip

另见 03 - 硬核开源项目图谱:39 个值得读源码的仓库,按推理引擎、Kernel、训练框架、集群编排分类。


LLM 基础

原文:https://se7en.mintlify.app/resources/llm-foundations

入门课程

资源类型简介配套资料
CSCI 1390, Spring 2025: Systems for Machine Learning课程主题包括高效训练和推理、ML 算法与硬件、GPU 编程、CUDA、Transformer 架构和高效检索。
CS336: Language Modeling from Scratch (Stanford / Spring 2025)课程从 tokenizer、Transformer 到分布式训练、数据处理和 RLHF 对齐,5 个实战 assignment 覆盖 LLM 全链路。视频
The Smol Training Playbook教程以 SmolLM3 的真实训练过程为主线,覆盖模型目标与规模选择、架构和数据配比、消融实验、分布式预训练、监控排障、评测及后训练。

从零构建 GPT

资源类型简介配套资料
Build a Large Language Model (From Scratch)书籍从零规划并编写 LLM 的各个组件,涵盖数据集准备、文本分类微调、指令对齐和加载预训练权重。GitHub
nanoGPT实践项目精简的 PyTorch GPT 训练与微调实现,可从字符级 toy GPT 入门,并进一步复现 GPT-2 124M,重点是理解语言模型的预训练过程。视频
nanochat实践项目nanoGPT 的后续项目,以单节点可运行、易修改的代码覆盖 tokenizer、预训练、微调、评测和推理,形成一个可实际对话的端到端 ChatGPT 训练流程。

训练与 Scaling

原文:https://se7en.mintlify.app/resources/training

模型架构与 Scaling

资源类型简介配套资料
How to Scale Your Model在线书籍从系统视角讲解 LLM 在 TPU 和 GPU 上的训练与推理扩展,涵盖 Roofline 分析、硬件互连、Transformer 计算与内存、并行策略,以及基于 JAX 的性能分析与编程实践。GitHub
Awesome-LM-Architecture资源合集按核心组件、模型架构、扩展与预训练、模型技术报告整理语言模型架构,涵盖位置编码、归一化、Attention、线性模型、Test-Time Learning、MoE 和 Scaling Laws。

预训练、RL 与基础设施

资源类型简介
MAI-Thinking-1: Building a Hill-Climbing Machine技术报告微软 MAI-Thinking-1 技术报告,涵盖 MoE 架构、Scaling Ladder、预训练数据、长周期 RL、评测以及大规模训练和推理基础设施。

Test-Time Training

资源类型简介
Test-Time Training Done Right论文提出 Large Chunk Test-Time Training,通过大块在线更新提升 GPU 利用率和非线性状态容量,并将测试时训练扩展到语言、图像与视频的长上下文任务。

推理与 Serving

原文:https://se7en.mintlify.app/resources/inference

系统概览与实践

资源类型简介
ai-inference-resources资源合集面向 AI 推理系统工程师的精选资源合集,涵盖 LLM Serving、GPU Kernel 编程、Attention、量化、分布式推理和生产部署。
Inside vLLM: Anatomy of a High-Throughput LLM Inference System官方博客从请求生命周期切入 vLLM,梳理输入处理、调度、模型执行、连续批处理和 KV Cache 管理等核心组件。
vLLM 源码解析博客以源码为主线介绍 vLLM 的请求处理、调度器、Worker、模型执行和 PagedAttention 等实现。
nano-vllm 源码解析视频基于精简版 nano-vllm 拆解推理引擎的调度循环、KV Cache、批处理和模型执行流程。

KV Cache

资源类型简介
LMCache 技术:计算与存储解耦下的分布式缓存演进论文合集以 LMCache 为主线串联 CacheGen、CacheBlend、TraCT 等相关工作,梳理 KV Cache 压缩、知识融合、传输与分布式缓存系统的演进。
Efficient Memory Management for Large Language Model Serving with PagedAttention论文提出 PagedAttention,以分页方式管理非连续 KV Cache,减少内存碎片和冗余复制,是 vLLM 高吞吐 Serving 的核心工作。
CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion论文复用不同知识块的 KV Cache,并选择性重算少量 Token 以融合跨块注意力,在保持生成质量的同时降低 RAG 的 TTFT。
SnapKV: LLM Knows What You are Looking for Before Generation论文从提示末尾的观察窗口识别各 Attention Head 关注的位置,仅保留聚类后的重要 KV,在无需微调的情况下压缩长上下文 KV Cache。

调度与批处理

资源类型简介
SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills论文将长 Prefill 切成固定大小的块,并在每个块中搭载 Decode 请求,以降低流水线气泡和批次间计算量波动。
Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve论文将 Chunked Prefill 与无停顿调度结合,在控制 Time Between Tokens 的同时提升吞吐并降低 Prefill 对 Decode 的干扰。
DeepSpeed-FastGen: High-throughput Text Generation for LLMs论文介绍 Dynamic SplitFuse、DeepSpeed-Inference 和 MII,通过动态组合 Prefill 与 Decode 工作提升生成吞吐和响应性。

PD 分离

资源类型简介
DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving论文将 Prefill 与 Decode 放到不同 GPU,并分别优化资源分配和并行策略,以同时满足 TTFT 与 TPOT 的服务目标。
Splitwise: Efficient Generative LLM Inference Using Phase Splitting论文根据 Prefill 的计算密集特征和 Decode 的内存密集特征拆分硬件池,实现分阶段独立扩缩容和异构资源配置。
TetriInfer: Inference without Interference论文结合固定大小的 Prompt 分块、Prefill-Decode 分离和资源预测驱动的两级调度,减少混合工作负载之间的干扰。
MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool论文通过弹性分布式内存池统一管理 KV Cache,把跨请求上下文缓存与 Prefill-Decode 分离结合起来。
Mooncake: A KVCache-centric Disaggregated Architecture论文Kimi 的 KV Cache 中心化推理架构,分离 Prefill 与 Decode 集群,并利用 CPU、DRAM 和 SSD 构建分布式 KV Cache。
DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference论文为多轮 Agent 推理增加 Storage-to-Decode KV Cache 加载路径,并用全局调度平衡 Prefill 与 Decode 侧的存储带宽。

推测解码

资源类型简介
Fast Inference from Transformers via Speculative Decoding论文让较小的 Draft Model 一次提出多个候选 Token,再由目标模型并行验证,在不改变输出分布的前提下减少串行解码步骤。
Accelerating Large Language Model Decoding with Speculative Sampling论文给出 Speculative Sampling 算法和理论分析,通过近似模型生成候选并由目标模型校正,实现无损采样加速。
Break the Sequential Dependency of LLM Inference Using Lookahead Decoding论文利用 Jacobi 迭代并行发现和验证高质量 N-gram,不依赖额外 Draft Model,减少自回归解码的串行依赖。
Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads论文在原模型上增加多个解码头预测后续 Token,并通过 Tree Attention 并行验证候选,避免部署独立 Draft Model。
How Speculative Decoding Boosts vLLM Performance by up to 2.8x官方博客介绍 vLLM 中推测解码的实现、配置、适用工作负载和基准结果,说明加速收益与开销的来源。

量化

资源类型简介
PyTorch 官方量化资料官方文档汇总 PyTorch 量化的核心概念、后训练量化、量化感知训练、相关 API 和后端支持。
PyTorch 量化实战项目实践项目以姿态估计模型为例演示 PyTorch 模型量化、校准、转换和量化前后的推理结果比较。

LLM 应用系统

资源类型简介
Parrot: Efficient Serving of LLM-based Applications with Semantic Variable论文用 Semantic Variable 暴露多个 LLM 请求之间的数据流关系,让 Serving 系统执行跨请求分析、调度和缓存优化。
Teola: Towards End-to-End Optimization of LLM-based Applications论文将应用工作流表示为细粒度数据流图,跨 LLM 与非 LLM 组件执行并行、流水线和端到端调度优化。

GPU 编程与 Kernel 优化

原文:https://se7en.mintlify.app/resources/gpu-programming

GPU 架构

资源类型简介
Building a Tiny GPU to Understand AI Hardware Engineering博客通过构建一个微型 GPU 模型理解线程执行、SIMT、Warp 调度、内存访问和矩阵计算等 AI 加速器基础机制。
A History of NVIDIA Stream Multiprocessor博客按 Tesla、Fermi、Kepler、Maxwell、Pascal 和 Turing 的演进梳理 NVIDIA SM、CUDA Core、Warp 与专用计算单元的变化。

CUDA

资源类型简介
CUDA 教程合集 - 比飞鸟贵重的多_HKL视频合集中文 CUDA 系列课程,从并行编程和 Kernel 基础逐步进入内存层次、常用算子实现与性能优化。
CUDA Programming Course - High-Performance Computing with GPUs视频课程系统介绍 CUDA 编程模型、线程层次、GPU 内存、Kernel 编写和高性能计算中的常见优化方法。
How to Optimize a CUDA Matmul Kernel for cuBLAS-like Performance: a Worklog博客从朴素 SGEMM 开始,逐步加入合并访存、共享内存、Block Tiling、向量化、自动调优和 Warp Tiling,逼近 cuBLAS 性能。
LeetCUDA资源合集面向初学者的现代 CUDA 学习笔记,包含 PyTorch、200 多个 CUDA Kernel、Tensor Core、HGEMM 和 FA-2 MMA。

TileLang

资源类型简介
TileLang Puzzles实践项目通过 10 个渐进式练习入门 TileLang,从基础操作逐步推进到 GEMM 和 FlashAttention。每道练习均可独立运行,并提供参考实现。

CUTLASS

资源类型简介配套资料
Learn CUTLASS the Hard Way!博客从朴素 FP32 GEMM 逐步推进到 BF16、Tensor Core、Swizzling、流水线、自动调优和 CUTLASS Kernel,并以 RTX 4090 为主要实验平台。视频
Learn CUTLASS the Hard Way - Part 2!博客面向 H100 与 Hopper 架构,介绍 Thread Block Cluster、TMA、Warp Specialization 等特性,并使用 CUTLASS 优化 GEMM。

Triton

资源类型简介
Deep Dive into Triton Internals (Part 1)博客总览 Triton 从 Python DSL 到 TTIR、TTGIR、LLVM IR、PTX 和 CUBIN 的编译与代码生成流程。
Deep Dive into Triton Internals (Part 2)博客跟踪 triton.compile 在 Python 前端和 C++ 原生层中的调用路径,解释 AST Source、缓存键和编译阶段的组织方式。
Deep Dive into Triton Internals (Part 3)博客深入 Triton 的 MLIR 后端,说明各类 Pass 如何逐步降低 IR 并生成面向 NVIDIA GPU 的代码。

FlashAttention

资源类型简介
FlashAttention from First Principles博客从标准 Attention 的内存瓶颈出发,推导分块、Online Softmax 和避免物化完整注意力矩阵的实现思路。
FlashAttention - Visually and Exhaustively Explained博客使用可视化示例解释 FlashAttention 的 Tiling、重计算、Online Softmax、前向与反向过程。
Flash Attention 2.0 with Tri Dao视频Tri Dao 讲解 FlashAttention-2 的算法设计、并行划分、GPU 利用率和相对第一版的优化。
Flash Attention 学习过程【详】解视频中文讲解 FlashAttention 的计算流程、公式推导、分块策略和实现中的关键细节。
ELI5: FlashAttention博客以直观方式解释 Attention 的显存访问开销,以及 FlashAttention 如何通过 IO-aware 计算降低 HBM 读写。
Designing Hardware-Aware Algorithms: FlashAttention教程从 GPU 内存层次和 Roofline 视角介绍硬件感知算法设计,并用 FlashAttention 展示计算与数据搬运的权衡。
FlashAttention: Fast and Memory-Efficient Exact Attention With IO-Awareness技术演讲NVIDIA GTC 演讲,系统介绍 IO-aware 精确 Attention、Kernel 实现与训练长上下文模型的性能收益。

性能分析与 Profiling

原文:https://se7en.mintlify.app/resources/performance-analysis

体系化学习

资源类型简介配套资料
AI Systems Performance Engineering书籍讲解 GPU CUDA Kernel 调优、PyTorch 算法优化、多节点训练和推理系统优化,并附有 175 多项实战优化清单。GitHub
How to Scale Your Model在线书籍涵盖 Roofline 分析、硬件互连、Transformer 计算与内存、并行策略,以及训练和推理的性能分析。GitHub
CSCI 1390, Spring 2025: Systems for Machine Learning课程主题包括高效训练和推理、ML 算法性能、GPU 编程、CUDA 和 Transformer 架构。

训练性能

资源类型简介
Stanford CS336 Assignment 2: Systems实践课程围绕 Transformer 训练系统实践性能基准测试、分析与优化,并实现分布式训练。整体计算资源要求不高,强烈推荐完整完成。

Profiling 工具

资源类型简介
PyTorch Profiling with NVIDIA Nsight教程详细讲解 Nsight Systems 和 Nsight Compute 的分工、报告采集、CLI 与 UI 分析、NVTX 标记、时间线解读,以及 PyTorch 常见性能瓶颈的诊断与优化。

RAG

原文:https://se7en.mintlify.app/resources/rag

RAG Serving 与系统优化

资源类型简介
METIS: Fast Quality-Aware RAG Systems with Configuration Adaptation论文联合调度查询并按请求调整检索块数量和答案合成策略,在生成质量与响应延迟之间动态权衡。

Agent 与 Harness 工程

原文:https://se7en.mintlify.app/resources/agents

Agent 基础与 Coding Agent

资源类型简介
Learn Claude Code实践课程从零构建类 Claude Code 的 AI Agent,12 个渐进式课程涵盖 Agent Loop、工具调用、子代理、上下文压缩、任务系统、多代理协作和 Worktree 隔离。
从零开始理解 Agent教程从极简实现出发,逐层拆解 OpenClaw、Claude Code 等 AI Agent 的循环、工具、记忆和 Skill 等核心概念。
nanoAgent实践项目通过小型代码和配套章节讲解大模型、Agent 与 Skill 的底层原理,并展示从最小 Agent Loop 到工程化能力的演进。

Harness Engineering

Harness Engineering 指的是一种开发方式:工程师设计环境、规则和测试反馈系统,让 AI Agent 自动生成并改进代码。

资源类型简介
Effective Harnesses for Long-Running Agents官方博客Anthropic 总结跨多个上下文窗口运行 Coding Agent 的方法,包括初始化 Agent、进度文件、功能清单、增量提交和端到端测试。
Harness Engineering: Leveraging Codex in an Agent-First World官方博客OpenAI 总结 Agent-first 软件工程实践,重点介绍仓库知识、可读环境、架构约束、自动化反馈和 Agent-to-Agent Review。
Minions: Stripe’s One-Shot, End-to-End Coding Agents官方博客介绍 Stripe 内部 Coding Agent Minions 如何从任务描述出发完成实现、验证并提交 Pull Request,以及支撑它的工程环境。
Minions: Stripe’s One-Shot, End-to-End Coding Agents - Part 2官方博客继续讨论 Minions 在大规模使用中的可靠性、人工审查、评测与迭代机制,以及每周合并大量 Agent PR 的实践经验。
Vibe Coding AReaL:零手打代码开发分布式 RL 训练框架博客记录使用 Coding Agent 开发分布式强化学习训练框架 AReaL 的过程,关注任务拆解、反馈循环和无手写代码协作方式。
Are Agent Harnesses Bringing Back Vibe Coding?视频讨论 Agent Harness 如何通过工具、上下文、约束和验证机制提升 Coding Agent 的自治能力,并重新界定 Vibe Coding。

自动化 AI 研究

资源类型简介
autoresearch实践项目让 AI Agent 在单 GPU 上自动修改 nanochat 训练代码,以固定 5 分钟预算运行实验、评估结果并保留有效改动,形成最小化的自动研究闭环。
First Steps Toward Automated AI Research研究博客Recursive 对自动研究系统的早期实践总结,涵盖长周期并行探索、结果验证,以及在 NanoChat、NanoGPT Speedrun 和 GPU Kernel 优化任务上的实验。

核心论文清单

原文:https://se7en.mintlify.app/resources/papers

KV Cache

长上下文与序列建模

模型训练与基础设施

推测解码

调度与批处理

PD 分离

LLM 应用


书籍

原文:https://se7en.mintlify.app/resources/books

书名简介资料
How to Scale Your Model从系统视角讲解 LLM 在 TPU 和 GPU 上的训练与推理扩展,涵盖 Roofline 分析、硬件互连、Transformer 计算与内存、并行策略,以及基于 JAX 的性能分析与编程实践。GitHub
AI Systems Performance Engineering逐步讲解 GPU CUDA Kernel 调优、基于 PyTorch 的算法优化以及多节点训练与推理系统的优化方法。同时涵盖 GPU 集群扩展、分布式模型训练和推理服务的性能调优。书末附 175+ 项经过验证的实战优化清单。GitHub
Build a Large Language Model (From Scratch)从零规划并编写 LLM 的各个组件,涵盖数据集准备、文本分类微调、基于人类反馈的指令对齐,以及加载预训练权重等完整流程。GitHub
nanoGPT精简的 PyTorch GPT 训练与微调实现,可从字符级 toy GPT 入门,并进一步复现 GPT-2 124M。项目已停止维护,作者推荐使用后续项目 nanochat配套视频

课程

原文:https://se7en.mintlify.app/resources/courses

LLM

课程简介
CSCI 1390, Spring 2025: Systems for Machine Learning主题包括高效训练和推理、理解如何构建硬件 ML 算法、理解 ML 算法性能、GPU 编程和 CUDA、Transformer 架构、高效检索等
CS336: Language Modeling from Scratch (Stanford / Spring 2025)
配套视频
手把手从零构建一个完整的语言模型——从 tokenizer、Transformer 到分布式训练、数据处理和 RLHF 对齐,5 个实战 assignment 覆盖 LLM 全链路,代码全部开源
The Smol Training Playbook以 SmolLM3 的真实训练过程为主线,覆盖模型目标与规模选择、架构和数据配比、消融实验、分布式预训练、监控排障、评测及后训练。内容串联了完整训练流程,适合作为 LLM 预训练入门指南。

性能分析

资料简介
Stanford CS336 Assignment 2: Systems围绕 Transformer 训练系统实践性能基准测试、分析与优化,并实现分布式训练。整体计算资源要求不高,强烈推荐完整完成。
PyTorch Profiling with NVIDIA Nsight详细讲解 Nsight Systems 和 Nsight Compute 的分工、报告采集、CLI 与 UI 分析、NVTX 标记、时间线解读,以及 PyTorch 常见性能瓶颈的诊断与优化。

GPU Kernel 编程

资料简介
TileLang Puzzles通过 10 个渐进式练习入门 TileLang,从基础操作逐步推进到 GEMM 和 FlashAttention。每道练习均可独立运行,并提供参考实现用于对照。

Agent

课程简介
Learn Claude Code从零到一构建一个类 Claude Code 的 AI Agent,12 个渐进式课程,涵盖 Agent Loop、工具调用、子代理、上下文压缩、任务系统、多代理协作、Worktree 隔离等机制
从零开始理解 Agent从一个极简开源项目 nanoAgent 出发,逐层拆解 OpenClaw / Claude Code 等 AI Agent 背后的全部核心概念