Spark-X2.5-4B-W4A16-AutoRound

Quantização em W4A16 (INT4) de alta precisão do modelo XHToken/Spark-X2.5-4B usando Intel AutoRound.

Detalhes Técnicos

  • Formato: auto_gptq (compatível com kernel Marlin, vLLM e SGLang)
  • Precisão: W4A16 (Pesos em INT4, Ativações em 16-bit / BF16)
  • Group Size: 128
  • Simetria: Simétrica (otimizada para vLLM Marlin kernel)
  • Iterações por bloco (iters): 200
  • Amostras de Calibração (nsamples): 128
  • Comprimento de Contexto (seqlen): 2048
  • Otimizações: enable_minmax_tuning=True, enable_norm_bias_tuning=True
  • Camadas Críticas: lm_head e embeddings preservados em BF16

Como Utilizar

Com vLLM (Marlin kernel):

from vllm import LLM, SamplingParams

llm = LLM(
    model="quant-mind/Spark-X2.5-4B-W4A16-AutoRound",
    quantization="gptq_marlin",
    trust_remote_code=True,
    max_model_len=4096
)

prompts = ["Olá! Como você pode me ajudar hoje?"]
params = SamplingParams(temperature=0.7, max_tokens=200)
outputs = llm.generate(prompts, params)
print(outputs[0].outputs[0].text)

Quantizado por quant-mind.

Downloads last month
138
Safetensors
Model size
4B params
Tensor type
I32
·
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for quant-mind/Spark-X2.5-4B-W4A16-AutoRound

Quantized
(28)
this model