文章
222026
KV Cache(二):从如何让GPU不摸鱼开始思考——MQA、GQA到MLA的计算拆解
KV Cache(一):从KV Cache看懂Attention(MHA、MQA、GQA、MLA)的优化之路
2025
从vibe到spec:可维护性视角下探讨为什么很多人的AI编程依然是小玩具
通过下游任务理解BERT和GPT的区别:不只是完形填空和词语接龙
为什么Embedding加上位置编码后不会破坏语义?
流形视角下的Embedding:从理论到RAG实践
Add & Norm(二)从传统CV到Transformer里的Normalization详解
Add & Norm:对残差连接深入解析(一)
为什么前馈神经网络(FFN)对Transformer这么重要(二):从激活函数到MOE
为什么前馈神经网络(FFN)对Transformer这么重要(一)
注意力机制之多头注意力(Multi-Head Attention)
Qwen3-8b的变化和能力初探
工程实现系列:从什么都不会到QLoRA分布式DPO(一)
LLM最长上下文的一些运用和理解
从什么都不会到QLoRA分布式DPO(二)
从tools use谈谈Deepseek的”联网搜索”怎么实现 2025-02-01
Transformer中的Q和K
浅谈CoT
更优雅的使用llm:DeepSeek API+Cherry Studio+激活CoT的Prompt
llm训练策略选择
Agent概述
2024
vue语法总结 2024-12-23
