LLM / 大模型
大模型原理、训练与 Agent 工程化
笔记列表 16
自动关联目录:LLM LLM 分类的外部资料索引。这个领域的特点是论文与工程实践脱节得厉害:论文看架构与动机,工程细节只能去仓库和博客里找。所以下面按"论文 / 官方仓库 / 工程博客"三类分开。 用法:先读 Tinie…
"数据决定上限,算法只是逼近这个上限。" —— 这条经验法则在 LLM 时代被反复验证。 1. 流水线总览 原始文本 → [清洗] → [去重] → [质量打分] → [分词] → [打包] → 分片(.npz) …
默认配置约 25M 参数(recipes/pretrain_tiny.yaml),但结构对齐 2025-2026 的主流做法。 tok_emb → [ Block × L ] → norm_f → lm_head(与 embedding 共…
1. 一次 step 在做什么(train/engine.py) for step: for i in range(grad_accum_steps): # 梯度累积:用小显存模拟大 batch los…
预训练得到的是"下一个 token 预测器";后训练把它变成"助手"。 1. SFT(posttrain/sft.py) 两个决定效果的细节: prompt masking:只对 response …
配套的 vLLM 对照(本项目模块 ↔ vLLM 文件、以及我们省略了什么) 见 07-vllm.md。建议两篇一起读。 推理系统的第一性问题:decode 是 memory-bound。 每生成一个 token 都要把「模型权重 +…
1. 整体结构 Backend(大脑) ←→ Agent(闭环) ├─ Planner(怎么想) ├─ ToolRegistry(能做什么) …
vLLM 是当前事实上的开源推理引擎标准。本项目刻意重新实现了它的核心机制 (而不是直接调库),目的就是让每个机制的原理可见;但生产实现里有大量 本项目为了可读性而刻意省略的工程细节。本文就是两者的对照表。 1. 模块对照表 本项目 …
对应 AIInfraGuide 路线第一层。 代码在 tiniestgpt/kernels/:csrc/ 是 .cu 源码,cuda_ops.py 是 Python 封装 (每个算子都带 PyTorch 参考实现,无 GPU 时自动降级)…
对应 AIInfraGuide 路线第二层。 代码在 tiniestgpt/train/parallel/ 与 tiniestgpt/common/memory_ledger.py。 0. 一句话世界观 所有的并行策略都是在回答同一…
对应 AIInfraGuide 路线 3.6(性能分析与 Benchmark)、3.7(优化选型决策树)、 以及"生产级服务特性"一节。代码在 inference/metrics.py、inference/struct…
本文是 TiniestGPT 的"外部坐标系"。 目的不是追新,而是回答一个问题:到 2026 年下半年,"全链路"这个词到底包含哪些技术? 每张表最后一列给出本项目对该技术的判定(已有 / P0 …
上游:docs/11-frontier-2026.md(前沿技术雷达与逐项判定) 本文回答两个问题:这个项目最终要长成什么样(Target),以及现在还差什么(Gap)。 更新方式:每完成一项,把本文件对应行的状态从 ✅ 改为 ✅,并同步…
自动关联目录:TiniestGPT 不是“一个能用的大模型”,而是一本能跑通的大模型全链路教科书: 数据 → 分词 → 架构 → 预训练 → 后训练 → 推理系统 → Agent 应用。 上游仓库:https://github.com/…
自动关联目录:LLM 这一分类记的是大模型的工程侧:数据怎么洗、词表怎么训、模型怎么改、算力怎么花、推理怎么快、服务怎么稳。 与 Base Knowledge / Artificial Intelligence 的分工很明确: 分类 …
0. 这个项目的定位 大模型工程可以拆成六个层次,每一层的"核心矛盾"都不同: 层 核心矛盾 关键指标 本项目对应 数据 质量 vs 规模 去重率、质量分分布、B/token tiniestgpt/data…