Qwen3.5-35B-A3B (3.5bit MLX Quantization)

This is the Qwen3.5-35B-A3B model, natively quantized to 3.5bit for the MLX framework by Apple. This version allows running a massive model on standard Apple Silicon Macs without experiencing immediate OOM (Out Of Memory) issues.

馃専 Experi锚ncia de Uso & Performance no Mac (Apple Silicon)

O formato 3.5-bits (mixed_3_4) se revelou o Sweet Spot (Ponto de Ouro) para modelos de 35 Bilh玫es de par芒metros. Ele roda com tranquilidade num Mac de 24GB sem causar gargalos na GPU, ao mesmo tempo que ret茅m a capacidade incr铆vel de racioc铆nio l贸gico (Chain of Thought).

Durante os testes locais para valida莽茫o dessa quantiza莽茫o, obtivemos os seguintes resultados de performance:

  • Pico de Mem贸ria (VRAM): Usou cerca de ~16.0 GB de mem贸ria unificada, deixando o sistema saud谩vel e sem swap pesado.
  • Velocidade de Gera莽茫o: Atingiu aproximadamente ~70 tokens/sec (Pode variar conforme o hardware e a temperatura do chip).
  • Estabilidade: Para evitar o erro kIOGPUCommandBufferCallbackErrorTimeout (GPU Timeout) comum no Mac ao processar tensores gigantes, o processo de quantiza莽茫o deste modelo foi roteado cirurgicamente pela CPU. Isso garantiu integridade e sucesso total na convers茫o.

馃殌 Como usar com oMLX (Recomendado)

oMLX is a high-performance serving engine for MLX models that exposes an OpenAI-compatible API.

1. Fa莽a o download para o seu cache local:

python -c "from huggingface_hub import snapshot_download; snapshot_download('faelfernandes/Qwen3.5-35B-A3B-3.5bit')"

2. Inicie o servidor oMLX:

omlx serve --model-dir ~/.cache/huggingface/hub/models--faelfernandes--Qwen3.5-35B-A3B-3.5bit/snapshots/main

3. Teste via API (Padr茫o OpenAI):

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen3.5-35B-A3B-3.5bit",
    "messages": [{"role": "user", "content": "Explique a teoria da relatividade."}],
    "temperature": 0.7
  }'

馃捇 Como usar direto com MLX-LM no Python

1. Instale as depend锚ncias:

pip install mlx-lm huggingface_hub

2. Script de Infer锚ncia:

from mlx_lm import load, generate

model, tokenizer = load("faelfernandes/Qwen3.5-35B-A3B-3.5bit")
response = generate(model, tokenizer, prompt="Explain quantum mechanics in one paragraph.", max_tokens=500)
print(response)

鈿欙笍 Detalhes da Quantiza莽茫o

  • Modelo Base: Qwen/Qwen3.5-35B-A3B
  • Quantiza莽茫o: 3.5bit
  • Framework: Apple MLX
  • Processamento: Convers茫o via CPU para m谩xima integridade e estabilidade.

Quantizado e otimizado com foco na experi锚ncia do usu谩rio de Mac. Por Rafael Fernandes 馃嚙馃嚪

Downloads last month
-
Safetensors
Model size
5B params
Tensor type
BF16
U32
F32
MLX
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 馃檵 Ask for provider support