Explore
AI Tools
New Tools
AI Agents
One9 Worker
LLMs
RAG & Vector DBs
Research
Assemble a stack
Founder Stacks
Compare
How We Rate
About
$
/
₹
⌘K
Sign up free
Login
Back to papers
June 23, 2026
cs.AI
CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference
Xiaolin Lin
,
Jingcun Wang
,
Olga Kondrateva
,
Yiyu Shi
,
Bing Li
,
Grace Li Zhang
Original Abstract
Read on arXiv
Download PDF
Categories
cs.AI