最新
KV Cache(二):从如何让GPU不摸鱼开始思考——MQA、GQA到MLA的计算拆解
完整对比 MHA、MQA、GQA、MLA 四种 Attention 在 KV Cache 优化上的表现,每一步都用具体数字算清楚:每种方案到底能省多少?代价是什么?瓶颈卡在哪?
阅读全文 →最新文章更多 →
历史文章 18 篇
1为什么Embedding加上位置编码后不会破坏语义?2025/9/28更新于 2/272流形视角下的Embedding:从理论到RAG实践2025/8/193Add & Norm(二)从传统CV到Transformer里的Normalization详解2025/7/28更新于 2/274Add & Norm:对残差连接深入解析(一)2025/6/12更新于 2/275为什么前馈神经网络(FFN)对Transformer这么重要(二):从激活函数到MOE2025/6/2更新于 2/276为什么前馈神经网络(FFN)对Transformer这么重要(一)2025/5/16更新于 2/277注意力机制之多头注意力(Multi-Head Attention)2025/5/5更新于 2/278Qwen3-8b的变化和能力初探2025/4/29



