Mooncake
A KVCache-centric disaggregated architecture for LLM serving.
An open-source KV-cache-centric platform for disaggregated LLM serving, providing shared KV-cache storage and transfer capabilities for inference systems including vLLM.

Recent stories
0 linked stories
No linked stories yet.