PuzzleKV compresses KV cache via page-wise low-rank decomposition, achieving over 96% of Full KV performance at 60% stor...

PuzzleKV compresses KV cache via page-wise low-rank decomposition, achieving over 96% of Full KV performance at 60% storage. It can combine with quantization to retain over 93% performance at 18.7% storage.Source: arXiv cs.LGhttps://arxiv.org/abs/2608.23843#MachineLearning

Read Original

Related

Mastodon discussion 9m ago

Как мы делали многоуровневую память для корпоративных AI-агентов в VK AI SpaceПривет, Хабр. Меня зовут Сергей Врулин, я ...

Как мы делали многоуровневую память для корпоративных AI-агентов в VK AI SpaceПривет, Хабр. Меня зовут Сергей Врулин, я Team Lead в команде агентов VK AI Space — корпоративной плат...