本文详细梳理了从GPT-2到KimiK3的Transformer架构演进历程,重点探讨了线性注意力、DeltaNet、Gated DeltaNet、Kimi Linear和最终KimiK3的设计思想与实现细节。文章指出,单纯扩大模型规模(如KimiK3的2.8万亿参数)并非进步的全部,每个架构迭代都旨在解决前代的局限性:线性注意力通过特征映射降低计算复杂度但牺牲精度;DeltaNet引入可擦写缓存以改善信息干扰;Gated DeltaNet结合遗忘门实现灵活记忆管理;Kimi Linear通过逐通道门控和混合注意力提升性能;最终KimiK3整合了常数状态递归注意力、周期softmax检索、稀疏专家和残差注意力,在保持推理效率的同时实现更优质量。文章包含大量Python伪代码和数学推导,适合对Transformer底层机制有深入理解需求的读者。