LLM 最浪费算力的地方,可能就是反复处理同一批上下文。
系统提示词、文档、历史内容一次次重复塞进去,GPU 也得跟着重新算。
最近看到一个 LMCache,专门解决 KV Cache 重复计算的问:
🧠 缓存已经算过的 KV,后续请求直接复用
支持 CPU、磁盘等多级缓存
🔌 可接 vLLM、SGLang 等推理框架
🚀 特别适合长上下文、RAG、多轮 Agent 场景
官方测试中,部分场景能做到 3–10 倍延迟优化。对于高频调用 LLM 的服务来说,这种基础设施优化还是挺有价值的。
🔗https://github.com/LMCache/LMCache

互联网充电优质资源
优质内容内幕消息
 
 
Back to Top