
		<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
			<channel>
				<title>José David Baena – Distributed Systems Engineer</title>
				<link>https://josedavidbaena.com</link>
				<description>Production notes and source-backed analysis on distributed systems, messaging infrastructure, open-source internals, and model engineering.</description>
				<language>en-us</language>
				<managingEditor>josedab@gmail.com (José David Baena)</managingEditor>
				<webMaster>josedab@gmail.com (José David Baena)</webMaster>
				<lastBuildDate>Tue, 14 Oct 2025 00:00:00 GMT</lastBuildDate>
				<atom:link href="https://josedavidbaena.com/tags/tutorial/feed.xml" rel="self" type="application/rss+xml"/>
				
		<item>
			<guid>https://josedavidbaena.com/blog/nanochat/building-chatgpt-for-100-dollars</guid>
			<title>Build Your Own ChatGPT for $100</title>
			<link>https://josedavidbaena.com/blog/nanochat/building-chatgpt-for-100-dollars</link>
			<description>Train a complete ChatGPT-like system from scratch for $100: tokenizer, pretraining, SFT, RL, deployment—the full LLM pipeline for the price of dinner.</description>
			<pubDate>Tue, 14 Oct 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>ai</category><category>tutorial</category><category>llm</category><category>deep-learning</category><category>pytorch</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/tiny-llm-fine-tuning-domain-adaptation</guid>
			<title>Fine-Tuning Tiny Models: LoRA, QLoRA, and Domain Adaptation Strategies</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/tiny-llm-fine-tuning-domain-adaptation</link>
			<description>Domain accuracy 8% to 68%. Cost $23 instead of $15,000. LoRA trains 0.1% of params. QLoRA adds 4-bit quantization. Six hours: generalist to expert.</description>
			<pubDate>Wed, 01 Oct 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>fine-tuning</category><category>lora</category><category>qlora</category><category>domain-adaptation</category><category>tutorial</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/quantization-aware-training-tutorial</guid>
			<title>Quantization-Aware Training: INT8/INT4 Models That Maintain Quality</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/quantization-aware-training-tutorial</link>
			<description>Naive INT8 drops MMLU 24%. QAT drops it 2.4%. Train with fake quantization so the model learns resilience. GPTQ, mixed-precision, deployment recipes.</description>
			<pubDate>Sat, 27 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>quantization</category><category>training</category><category>optimization</category><category>tutorial</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/knowledge-distillation-complete-tutorial</guid>
			<title>Knowledge Distillation: How to Train a 1.5B Model That Matches Your 7B</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/knowledge-distillation-complete-tutorial</link>
			<description>Llama-7B to 1.5B. 90% quality at 1/5 the size. 3× inference speed. From temperature-scaled softmax to production deployment—with working PyTorch code.</description>
			<pubDate>Tue, 23 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>distillation</category><category>training</category><category>tutorial</category><category>pytorch</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/efficient-attention-mechanisms-tiny-models</guid>
			<title>Efficient Attention Mechanisms for Tiny Language Models</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/efficient-attention-mechanisms-tiny-models</link>
			<description>Attention burns 50% of inference time and 75% of memory. MQA shrinks KV cache 4×. Flash Attention fuses kernels for 2–4× speedup. GQA splits the gap.</description>
			<pubDate>Fri, 19 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>attention</category><category>transformers</category><category>optimization</category><category>tutorial</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/model-compression-techniques-comprehensive-guide</guid>
			<title>Model Compression: 14GB to 450MB While Keeping 90% Quality</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/model-compression-techniques-comprehensive-guide</link>
			<description>14GB to 450MB. 12 to 60 tokens/sec. 90% quality retained. Four techniques—distillation, quantization, pruning, LoRA—that compose. PyTorch code included.</description>
			<pubDate>Mon, 15 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>model-compression</category><category>distillation</category><category>quantization</category><category>pruning</category><category>lora</category><category>tutorial</category>
		</item>
	
			</channel>
		</rss>
	