Oct 17, 2025/20 mins readNanoChat·Technical Deep Dives·Part 3/13Distributed Muon: Custom Gradient Synchronization for Memory-Efficient Training
Oct 15, 2025/21 mins readNanoChat·Technical Deep Dives·Part 2/13The Muon Optimizer Explained: Why Orthogonal Gradients Work
Sep 23, 2025/20 mins readTiny Language Models·Training & Optimization·Part 6/10Knowledge Distillation: How to Train a 1.5B Model That Matches Your 7B