Part 8:LLM 基础:以 GPT-2 为例
| Title | Author | Date |
|---|---|---|
| 18.1 语言模型在预测什么:Next-Token Prediction | 2026-06-18 | |
| 18.2 MiniGPT:从 Causal GPT Block 到语言模型 | 2026-06-20 | |
| 18.3 Tokenizer:字符、BPE 与词表 | 2026-06-18 | |
| 18.4 Embedding、LM Head 与 Weight Tying | 2026-06-18 | |
| 18.5 在 TinyStories 上训练 MiniGPT | 2026-06-22 | |
| 18.6 从训练到生成:Temperature、Top-k、Top-p | 2026-06-18 | |
| 18.7 GPT-2:从 MiniGPT 到预训练语言模型 | 2026-06-23 | |
| 19.1 LLM 训练显存账本:参数、激活与状态 | 2026-08-15 | |
| 19.2 FLOPs、Memory 与 Arithmetic Intensity:为什么不是只看计算量 | 2026-09-16 | |
| 19.3 Profiling:怎么知道代码慢在哪里 | 2026-09-10 | |
| 19.4 Mixed Precision:FP32、FP16、BF16 与 Loss Scaling | 2026-09-10 | |
| 19.5 Gradient Accumulation:显存不够时如何模拟大 Batch | 2026-09-08 | |
| 19.6 Activation Checkpointing:用重计算换显存 | 2026-09-13 | |
| 19.7 现代 Attention API 与 Hugging Face Kernels | 2026-09-12 | |
| 19.8 Triton 入门:什么时候需要自己写 Kernel | 2026-09-11 | |
| 19.9 分布式训练入门:DDP、ZeRO 与 FSDP 的直觉 | 2026-09-14 |
No matching items