
		<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
			<channel>
				<title>José David Baena – Distributed Systems Engineer</title>
				<link>https://josedavidbaena.com</link>
				<description>Production notes and source-backed analysis on distributed systems, messaging infrastructure, open-source internals, and model engineering.</description>
				<language>en-us</language>
				<managingEditor>josedab@gmail.com (José David Baena)</managingEditor>
				<webMaster>josedab@gmail.com (José David Baena)</webMaster>
				<lastBuildDate>Wed, 02 Sep 2026 00:00:00 GMT</lastBuildDate>
				<atom:link href="https://josedavidbaena.com/tags/quantization/feed.xml" rel="self" type="application/rss+xml"/>
				
		<item>
			<guid>https://josedavidbaena.com/blog/distilled-engineering/llm-compression-decision-matrix</guid>
			<title>LLM Compression Decision Matrix: Let the Bottleneck Pick the Technique</title>
			<link>https://josedavidbaena.com/blog/distilled-engineering/llm-compression-decision-matrix</link>
			<description>Choose pruning, quantization, distillation, LoRA, or MoE from the production bottleneck, then re-gate the exported artifact on target hardware.</description>
			<pubDate>Wed, 02 Sep 2026 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>llm</category><category>model-compression</category><category>quantization</category><category>pruning</category><category>distillation</category><category>lora</category><category>mixture-of-experts</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/distilled-engineering/model-distillation-antipatterns</guid>
			<title>Model Distillation Breaks in the Same Ten Places Every Time</title>
			<link>https://josedavidbaena.com/blog/distilled-engineering/model-distillation-antipatterns</link>
			<description>A field guide to ten recurring distillation failures across data, evaluation, compression, serving, safety, and release governance.</description>
			<pubDate>Wed, 26 Aug 2026 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>model-distillation</category><category>llm</category><category>ai-safety</category><category>mlops</category><category>quantization</category><category>ai-engineering</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/kimi-k3/04-checkpoint-parameter-accounting</guid>
			<title>How 2.8T Parameters Fit in a 1.56 TB Kimi K3 Checkpoint</title>
			<link>https://josedavidbaena.com/blog/kimi-k3/04-checkpoint-parameter-accounting</link>
			<description>Reconstruct how Kimi K3&#39;s 1.561 TB snapshot combines packed FP4 values, scales, BF16/F32 tensors, shard overhead, and repository files.</description>
			<pubDate>Thu, 30 Jul 2026 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>kimi-k3</category><category>quantization</category><category>mxfp4</category><category>model-weights</category><category>checkpoint</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/quantization-aware-training-tutorial</guid>
			<title>Quantization-Aware Training: INT8/INT4 Models That Maintain Quality</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/quantization-aware-training-tutorial</link>
			<description>Naive INT8 drops MMLU 24%. QAT drops it 2.4%. Train with fake quantization so the model learns resilience. GPTQ, mixed-precision, deployment recipes.</description>
			<pubDate>Sat, 27 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>quantization</category><category>training</category><category>optimization</category><category>tutorial</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/model-compression-techniques-comprehensive-guide</guid>
			<title>Model Compression: 14GB to 450MB While Keeping 90% Quality</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/model-compression-techniques-comprehensive-guide</link>
			<description>14GB to 450MB. 12 to 60 tokens/sec. 90% quality retained. Four techniques—distillation, quantization, pruning, LoRA—that compose. PyTorch code included.</description>
			<pubDate>Mon, 15 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>model-compression</category><category>distillation</category><category>quantization</category><category>pruning</category><category>lora</category><category>tutorial</category>
		</item>
	
		<item>
			<guid>https://josedavidbaena.com/blog/tiny-language-models/tiny-language-models-math-foundations</guid>
			<title>Mathematical Foundations of Model Compression: Theory Behind Tiny LLMs</title>
			<link>https://josedavidbaena.com/blog/tiny-language-models/tiny-language-models-math-foundations</link>
			<description>Quantization cuts size 75% at 2% accuracy loss. Distillation transfers soft labels. Pruning exploits the Lottery Ticket Hypothesis. The math behind it.</description>
			<pubDate>Wed, 10 Sep 2025 00:00:00 GMT</pubDate>
			<author>josedab@gmail.com (José David Baena)</author>
			<category>machine-learning</category><category>deep-learning</category><category>model-compression</category><category>quantization</category><category>distillation</category><category>mathematics</category>
		</item>
	
			</channel>
		</rss>
	