长上下文推理时 KV 缓存会顶满显存,这个项目让设备端 KV 池小于逻辑上下文,超出的页放到主机内存,需要时按内容相关性检索搬回设备并复用。
https://github.com/1314521gjy/ninfer-fusion-kvmem

互联网充电|优质资源
优质内容|内幕消息
 
 
Back to Top