Still
Amortized KV Cache Compaction in a Single Forward Pass
Still is Baseten’s research-described KV cache compaction method/tool: a small per-layer Perceiver trained once against a frozen base language model to produce compact keys and values in a single forward pass for long-context language-model inference.

Recent stories
0 linked stories
No linked stories yet.