RestoreKV-Qwen3-8B_plus

PEFT LoRA adapter + restore-token embeddings for RestoreKV (paper), a budget-matched, single-pass plug-in that recovers full-cache behavior under aggressive KV cache eviction on top of KVzip.

  • Base model: Qwen/Qwen3-8B — base scorer: KVzip+
  • adapter_model.safetensors: rank-8 LoRA (α=16) on q/k/v/o/gate/up/down proj
  • restore_embeddings.safetensors: 8 learned restore-token embeddings

Load via the RestoreKVPress in NVIDIA/kvpress.

License

CC BY-NC 4.0 (distilled with LongAlpaca-derived data; research / non-commercial).

Downloads last month
10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for higokri/RestoreKV-Qwen3-8B_plus

Finetuned
Qwen/Qwen3-8B
Adapter
(1988)
this model

Collection including higokri/RestoreKV-Qwen3-8B_plus

Paper for higokri/RestoreKV-Qwen3-8B_plus