
		<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
			<channel>
				<title>José David Baena – Distributed Systems Engineer</title>
				<link>https://josedavidbaena.com</link>
				<description>Production notes and source-backed analysis on distributed systems, messaging infrastructure, open-source internals, and model engineering.</description>
				<language>en-us</language>
				<managingEditor>josedab@gmail.com (José David Baena)</managingEditor>
				<webMaster>josedab@gmail.com (José David Baena)</webMaster>
				<lastBuildDate>Wed, 12 Aug 2026 00:00:00 GMT</lastBuildDate>
				<atom:link href="https://josedavidbaena.com/tags/machine-learning/feed.xml" rel="self" type="application/rss+xml"/>
				
		<item>
			<guid>https://josedavidbaena.com/blog/distilled-engineering/dark-knowledge-soft-targets</guid>
			<title>Dark Knowledge: What a Teacher&#39;s Wrong Answers Are Actually Worth</title>
			<link>https://josedavidbaena.com/blog/distilled-engineering/dark-knowledge-soft-targets</link>
			<description>Learn what soft targets preserve beyond hard labels, how temperature and KL direction change the signal, and when top-k logit storage loses too much.</description>
			<pubDate>Wed, 12 Aug 2026 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>model-distillation</category><category>knowledge-distillation</category><category>llm</category><category>machine-learning</category><category>ai-engineering</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/kimi-k3/02-architecture-kda-attnres-experts</guid>
			<title>Inside Kimi K3: How KDA, AttnRes, and 896 Experts Work</title>
			<link>https://josedavidbaena.com/blog/kimi-k3/02-architecture-kda-attnres-experts</link>
			<description>Trace Kimi K3&#39;s 69 KDA layers, 24 gated MLA layers, Attention Residuals, and 896 experts without overstating what released artifacts prove.</description>
			<pubDate>Tue, 28 Jul 2026 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>kimi-k3</category><category>architecture</category><category>attention</category><category>mixture-of-experts</category><category>machine-learning</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/nanochat/building-chatgpt-for-100-dollars</guid>
			<title>Build Your Own ChatGPT for $100</title>
			<link>https://josedavidbaena.com/blog/nanochat/building-chatgpt-for-100-dollars</link>
			<description>Train a complete ChatGPT-like system from scratch for $100: tokenizer, pretraining, SFT, RL, deployment—the full LLM pipeline for the price of dinner.</description>
			<pubDate>Tue, 14 Oct 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>ai</category><category>tutorial</category><category>llm</category><category>deep-learning</category><category>pytorch</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/tiny-llm-case-studies-production</guid>
			<title>Tiny LLM Deployment Patterns: Architecture Blueprints from Published Benchmarks</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/tiny-llm-case-studies-production</link>
			<description>Deployment patterns for tiny LLMs in healthcare, legal, manufacturing, and edge—grounded in published benchmarks from Microsoft, Apple, and MLPerf.</description>
			<pubDate>Mon, 13 Oct 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>deployment-patterns</category><category>production</category><category>benchmarks</category><category>architecture</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/tiny-llm-edge-deployment-guide</guid>
			<title>Edge Device Deployment: Running Tiny LLMs on Raspberry Pi, Mobile, and IoT</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/tiny-llm-edge-deployment-guide</link>
			<description>2 tokens/sec naive. 28 tokens/sec optimized. Same Raspberry Pi 4. INT4 quantization, llama.cpp, and ARM NEON turn cloud models into edge deployments.</description>
			<pubDate>Sat, 04 Oct 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>edge-computing</category><category>deployment</category><category>raspberry-pi</category><category>mobile</category><category>optimization</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/tiny-llm-fine-tuning-domain-adaptation</guid>
			<title>Fine-Tuning Tiny Models: LoRA, QLoRA, and Domain Adaptation Strategies</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/tiny-llm-fine-tuning-domain-adaptation</link>
			<description>Domain accuracy 8% to 68%. Cost $23 instead of $15,000. LoRA trains 0.1% of params. QLoRA adds 4-bit quantization. Six hours: generalist to expert.</description>
			<pubDate>Wed, 01 Oct 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>fine-tuning</category><category>lora</category><category>qlora</category><category>domain-adaptation</category><category>tutorial</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/quantization-aware-training-tutorial</guid>
			<title>Quantization-Aware Training: INT8/INT4 Models That Maintain Quality</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/quantization-aware-training-tutorial</link>
			<description>Naive INT8 drops MMLU 24%. QAT drops it 2.4%. Train with fake quantization so the model learns resilience. GPTQ, mixed-precision, deployment recipes.</description>
			<pubDate>Sat, 27 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>quantization</category><category>training</category><category>optimization</category><category>tutorial</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/knowledge-distillation-complete-tutorial</guid>
			<title>Knowledge Distillation: How to Train a 1.5B Model That Matches Your 7B</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/knowledge-distillation-complete-tutorial</link>
			<description>Llama-7B to 1.5B. 90% quality at 1/5 the size. 3× inference speed. From temperature-scaled softmax to production deployment—with working PyTorch code.</description>
			<pubDate>Tue, 23 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>distillation</category><category>training</category><category>tutorial</category><category>pytorch</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/tiny-llm-architecture-comparison</guid>
			<title>Tiny LLM Architecture Comparison: TinyLlama vs Phi-2 vs Gemma vs MobileLLM</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/tiny-llm-architecture-comparison</link>
			<description>Seven tiny models, one decision. Phi-2 wins on reasoning (56.7% MMLU). MobileLLM on speed (120 tok/s). Qwen on multilingual. Match constraints to model.</description>
			<pubDate>Sat, 20 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>llm</category><category>architecture</category><category>benchmarks</category><category>comparison</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/efficient-attention-mechanisms-tiny-models</guid>
			<title>Efficient Attention Mechanisms for Tiny Language Models</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/efficient-attention-mechanisms-tiny-models</link>
			<description>Attention burns 50% of inference time and 75% of memory. MQA shrinks KV cache 4×. Flash Attention fuses kernels for 2–4× speedup. GQA splits the gap.</description>
			<pubDate>Fri, 19 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>attention</category><category>transformers</category><category>optimization</category><category>tutorial</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/model-compression-techniques-comprehensive-guide</guid>
			<title>Model Compression: 14GB to 450MB While Keeping 90% Quality</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/model-compression-techniques-comprehensive-guide</link>
			<description>14GB to 450MB. 12 to 60 tokens/sec. 90% quality retained. Four techniques—distillation, quantization, pruning, LoRA—that compose. PyTorch code included.</description>
			<pubDate>Mon, 15 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>model-compression</category><category>distillation</category><category>quantization</category><category>pruning</category><category>lora</category><category>tutorial</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/tiny-language-models-math-foundations</guid>
			<title>Mathematical Foundations of Model Compression: Theory Behind Tiny LLMs</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/tiny-language-models-math-foundations</link>
			<description>Quantization cuts size 75% at 2% accuracy loss. Distillation transfers soft labels. Pruning exploits the Lottery Ticket Hypothesis. The math behind it.</description>
			<pubDate>Wed, 10 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>deep-learning</category><category>model-compression</category><category>quantization</category><category>distillation</category><category>mathematics</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/tiny-language-models-complete-guide</guid>
			<title>Tiny Language Models: How 1.3B Parameters Can Beat 7B on Reasoning</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/tiny-language-models-complete-guide</link>
			<description>Microsoft Phi-1.5 (1.3B) matches models 5× larger on reasoning. TinyLlama hit ~1T tokens for 3 epochs. Data quality beats size—and that changes things.</description>
			<pubDate>Fri, 05 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>ai</category><category>tiny-llm</category><category>efficient-models</category><category>edge-computing</category><category>mobile-ai</category>
		</item>
	
			</channel>
		</rss>
	