Nov 26, 2025/25 mins readNanoChat·Practical Guides·Part 13/13Memory Optimization Techniques: Gradient Accumulation & Mixed Precision
Nov 24, 2025/25 mins readNanoChat·Practical Guides·Part 12/13Tokenizer Design Choices: BPE, Vocabulary, and Implementation
Nov 18, 2025/28 mins readNanoChat·Practical Guides·Part 10/13Reinforcement Learning from Human Feedback (RLHF)
Nov 05, 2025/23 mins readNanoChat·Technical Deep Dives·Part 7/13Loss Landscape & Scaling Laws: Understanding Training Dynamics
Oct 31, 2025/21 mins readNanoChat·Technical Deep Dives·Part 6/13Training Data Pipeline: Streaming Tokenization at Scale
Oct 22, 2025/26 mins readNanoChat·Technical Deep Dives·Part 5/13Modern Transformer Architecture: RoPE, QK Norm, and Design Choices
Oct 20, 2025/26 mins readNanoChat·Technical Deep Dives·Part 4/13KV Caching Deep-Dive: Memory-Efficient Transformer Inference
Oct 17, 2025/20 mins readNanoChat·Technical Deep Dives·Part 3/13Distributed Muon: Custom Gradient Synchronization for Memory-Efficient Training
Oct 15, 2025/21 mins readNanoChat·Technical Deep Dives·Part 2/13The Muon Optimizer Explained: Why Orthogonal Gradients Work