LLM

自动关联目录:LLM

这一分类记的是大模型的工程侧:数据怎么洗、词表怎么训、模型怎么改、算力怎么花、推理怎么快、服务怎么稳。

与 Base Knowledge / Artificial Intelligence 的分工很明确:

分类回答什么典型问题
Artificial Intelligence为什么能学会损失函数的含义、注意力在做什么、扩散为什么work
LLM(本分类)怎么把它造出来并跑起来数据配比、BPE 词表、KV Cache、并行切分、首 token 延迟

一句话:原理决定上限,工程决定能不能落地。同一个 Transformer,工程差的实现可能慢十倍、贵十倍。

主线:TiniestGPT

TiniestGPT 是本分类的主体,按"从零训一个能跑的大模型"的全链路组织:

阶段章节
入门学习路线:如何用 TiniestGPT 学完大模型全链路
数据数据:决定模型上限的第一环
架构模型架构:小参数量、全先进技术
训练预训练工程 → 后训练
推理推理优化与 AI Infra → vLLM 对照 → CUDA 算子
规模化分布式训练:显存账本与 3D 并行
上线服务化、可观测与部署
应用Agentic 框架
视野前沿技术雷达(2026 H2) → Target 定义与 Gap 分析

建议的读法:先顺着编号读一遍建立全貌,再挑与自己工作最接近的一环往深里钻。推理与 Infra 是这套笔记写得最厚的部分,也是日常最容易碰到问题的地方。

一条贯穿全篇的主线索

大模型工程里的所有优化,本质上都在跟三样资源做交易:

资源瓶颈表现常见解法
显存OOM、batch 开不大、上下文上不去KV Cache 分页、激活重计算、ZeRO 切分、量化
带宽GPU 利用率低、kernel 在等数据算子融合、FlashAttention、权重量化减少搬运
算力训练/推理太慢混合精度、张量并行、更好的切分策略

判断一个优化值不值,先问它省的是显存、带宽还是算力。答不上来的优化,多半是玄学。

与其他分类的关系

Base Knowledge / Artificial Intelligence(原理)
        │  注意力、Transformer、RLHF
        ▼
      LLM(工程:数据 → 训练 → 推理 → 服务)
        │
        ├──► Programing / Cuda(算子与并行编程)
        └──► Programing / Python(训练与服务的胶水层)

参考