mini-engram-hanhai — a "memory cartridge" LoRA adapter

A pure LoRA adapter (rank 16, 40,370,176 params, bf16, ~81 MB, no base weights) that stores an entire tenant's knowledge as parameters. Attach it to Qwen/Qwen2.5-7B-Instruct and every baked-in fact is recovered — closed-book, no retrieval, no context tokens consumed.

This adapter memorizes the internal wiki of "Hanhai Robotics" (瀚海机器人), a fictional company programmatically generated by scripts/make_demo_corpus.py (93 self-study QA pairs). The corpus contains no real data, so the base model cannot know any of these facts — its closed-book F1 of 0.113 confirms zero leakage.

closed-book F1
Qwen2.5-7B-Instruct (base) 0.113
base + this adapter 0.664

Companion adapter (second tenant): mini-engram-xinglan. Multi-tenant serving = one base process + one such cartridge per tenant.

Usage

from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct", device_map="auto")
model = PeftModel.from_pretrained(base, "tersemind/mini-engram-hanhai")
tok = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-7B-Instruct")

Or serve both tenants at once with vLLM (OpenAI-compatible):

vllm serve Qwen/Qwen2.5-7B-Instruct --enable-lora --max-lora-rank 64 \
  --lora-modules xinglan=tersemind/mini-engram-xinglan hanhai=tersemind/mini-engram-hanhai

Links

License

MIT, © 2026 TerseMind. This adapter is a derivative of Qwen/Qwen2.5-7B-Instruct (Apache 2.0); redistribution must retain the base model's LICENSE and notices.

Downloads last month
10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tersemind/mini-engram-hanhai

Base model

Qwen/Qwen2.5-7B
Adapter
(2764)
this model