LLM
自动关联目录:LLM
这一分类记的是大模型的工程侧:数据怎么洗、词表怎么训、模型怎么改、算力怎么花、推理怎么快、服务怎么稳。
与 Base Knowledge / Artificial Intelligence 的分工很明确:
| 分类 | 回答什么 | 典型问题 |
|---|---|---|
Artificial Intelligence | 为什么能学会 | 损失函数的含义、注意力在做什么、扩散为什么work |
LLM(本分类) | 怎么把它造出来并跑起来 | 数据配比、BPE 词表、KV Cache、并行切分、首 token 延迟 |
一句话:原理决定上限,工程决定能不能落地。同一个 Transformer,工程差的实现可能慢十倍、贵十倍。
主线:TiniestGPT
TiniestGPT 是本分类的主体,按"从零训一个能跑的大模型"的全链路组织:
| 阶段 | 章节 |
|---|---|
| 入门 | 学习路线:如何用 TiniestGPT 学完大模型全链路 |
| 数据 | 数据:决定模型上限的第一环 |
| 架构 | 模型架构:小参数量、全先进技术 |
| 训练 | 预训练工程 → 后训练 |
| 推理 | 推理优化与 AI Infra → vLLM 对照 → CUDA 算子 |
| 规模化 | 分布式训练:显存账本与 3D 并行 |
| 上线 | 服务化、可观测与部署 |
| 应用 | Agentic 框架 |
| 视野 | 前沿技术雷达(2026 H2) → Target 定义与 Gap 分析 |
建议的读法:先顺着编号读一遍建立全貌,再挑与自己工作最接近的一环往深里钻。推理与 Infra 是这套笔记写得最厚的部分,也是日常最容易碰到问题的地方。
一条贯穿全篇的主线索
大模型工程里的所有优化,本质上都在跟三样资源做交易:
| 资源 | 瓶颈表现 | 常见解法 |
|---|---|---|
| 显存 | OOM、batch 开不大、上下文上不去 | KV Cache 分页、激活重计算、ZeRO 切分、量化 |
| 带宽 | GPU 利用率低、kernel 在等数据 | 算子融合、FlashAttention、权重量化减少搬运 |
| 算力 | 训练/推理太慢 | 混合精度、张量并行、更好的切分策略 |
判断一个优化值不值,先问它省的是显存、带宽还是算力。答不上来的优化,多半是玄学。
与其他分类的关系
Base Knowledge / Artificial Intelligence(原理)
│ 注意力、Transformer、RLHF
▼
LLM(工程:数据 → 训练 → 推理 → 服务)
│
├──► Programing / Cuda(算子与并行编程)
└──► Programing / Python(训练与服务的胶水层)参考
- TiniestGPT 上游仓库——本分类内容的来源,随上游更新同步
许可协议:CC BY
作者:Davids
本文链接:https://hustjjd.github.io/8aae3dc3.html
更新于:2026年10月10日