Tiny Models
Collection
Tiny models used for testing • 14 items • Updated • 2
This is an MXFP4-quantized version of inference-optimization/Kimi-K3-0.40B, a tiny model derived from moonshotai/Kimi-K3. Created for testing and development.
mxfp4-pack-quantized), group size 32Matches the quantization scheme used in moonshotai/Kimi-K3:
| Field | Value |
|---|---|
| Format | mxfp4-pack-quantized |
| Weights | 4-bit float, group_size=32, minmax observer |
| Scale dtype | torch.uint8 |
| Activations | unquantized (W4A16) |
| Ignored layers | self_attn, shared_experts, lm_head, vision_tower |
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from compressed_tensors.offload import dispatch_model
model = AutoModelForCausalLM.from_pretrained(
"inference-optimization/Kimi-K3-0.40B-MXFP4",
trust_remote_code=True,
dtype=torch.bfloat16,
)
tokenizer = AutoTokenizer.from_pretrained(
"inference-optimization/Kimi-K3-0.40B-MXFP4",
trust_remote_code=True,
)
dispatch_model(model)
sample = tokenizer("Hello my name is", return_tensors="pt")
sample = {k: v.to(model.device) for k, v in sample.items()}
output = model.generate(
**sample,
max_new_tokens=100,
eos_token_id=tokenizer.eos_token_id,
pad_token_id=tokenizer.pad_token_id,
)
print(tokenizer.decode(output[0].tolist(), skip_special_tokens=True))
Quantized using llm-compressor:
from transformers import AutoModelForCausalLM, AutoTokenizer
from llmcompressor import oneshot
from llmcompressor.modifiers.quantization import QuantizationModifier
MODEL_ID = "inference-optimization/Kimi-K3-0.40B"
model = AutoModelForCausalLM.from_pretrained(MODEL_ID, trust_remote_code=True)
tokenizer = AutoTokenizer.from_pretrained(MODEL_ID, trust_remote_code=True)
recipe = QuantizationModifier(
targets="Linear",
scheme="MXFP4A16",
ignore=[
"re:.*self_attn.*",
"re:.*shared_experts.*",
"re:.*lm_head.*",
"re:.*vision_tower.*",
],
)
oneshot(model=model, recipe=recipe)
model.save_pretrained(SAVE_DIR, save_compressed=True)
tokenizer.save_pretrained(SAVE_DIR)
trust_remote_code=True is required to load the custom modeling files.dtype=torch.bfloat16 to match the decompressed weight dtype.Base model
moonshotai/Kimi-K3