互联网从业者充电站
4 小时前
长上下文推理时 KV 缓存会顶满显存,这个项目让设备端 KV 池小于逻辑上下文,超出的页放到主机内存,需要时按内容相关性检索搬回设备并复用。
https://github.com/1314521gjy/ninfer-fusion-kvmem
互联网充电
|
优质资源
优质内容
|
内幕消息
Home
Powered by
BroadcastChannel
&
Sepia