CoRM-182M (Top-2)

Contrastive Routing Mixture-of-Experts (CoRM). Checkpoint for the paper Beyond Magnitude: Contrastive Routing for Modular Mixture-of-Experts.

Part of the ilsp/CoRM collection.

Model Active Params Total Params Routing
CoRM-182M-top2 266M 777M Top-2

Architecture

Hidden size 768
Layers 12
Attention heads 12 (4 KV heads, GQA)
Intermediate size 3072
Experts 8
Experts per token 2
Vocab size 51200
Max position embeddings 1024
Dtype bfloat16

Usage

This model uses custom modeling code, so trust_remote_code=True is required.

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "ilsp/CoRM-182M-top2"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True)

inputs = tokenizer("The capital of Greece is", return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=32)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Training

Evaluation

Citation

Downloads last month
-
Safetensors
Model size
0.8B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Paper for ilsp/CoRM-182M-top2