KV Cache:撐爆 GPU 倉庫的推論優化,以及大家怎麼救它
KV Cache 把算過的 Key/Value 存下來,避免自回歸生成時重算,代價是記憶體隨序列長度暴增;MQA/GQA、MLA、Sliding Window、Streaming LLM、KV pruning、跨對話 prefix 共用都是為了讓這個「倉庫」撐久一點。
Tag
2 篇文章
KV Cache 把算過的 Key/Value 存下來,避免自回歸生成時重算,代價是記憶體隨序列長度暴增;MQA/GQA、MLA、Sliding Window、Streaming LLM、KV pruning、跨對話 prefix 共用都是為了讓這個「倉庫」撐久一點。
Self-Attention 本質上分不出 Token 的先後順序,所以要靠位置編碼把順序補回來。這篇從最早的 Absolute Positional Embedding 講到 Sinusoidal 位置編碼,並拆解它為何能隱含相對位置資訊。