Instructions to use faelfernandes/Qwen3.5-35B-A3B-3.5bit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use faelfernandes/Qwen3.5-35B-A3B-3.5bit with MLX:
# Download the model from the Hub pip install huggingface_hub[hf_xet] huggingface-cli download --local-dir Qwen3.5-35B-A3B-3.5bit faelfernandes/Qwen3.5-35B-A3B-3.5bit
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
Qwen3.5-35B-A3B (3.5bit MLX Quantization)
This is the Qwen3.5-35B-A3B model, natively quantized to 3.5bit for the MLX framework by Apple. This version allows running a massive model on standard Apple Silicon Macs without experiencing immediate OOM (Out Of Memory) issues.
馃専 Experi锚ncia de Uso & Performance no Mac (Apple Silicon)
O formato 3.5-bits (mixed_3_4) se revelou o Sweet Spot (Ponto de Ouro) para modelos de 35 Bilh玫es de par芒metros. Ele roda com tranquilidade num Mac de 24GB sem causar gargalos na GPU, ao mesmo tempo que ret茅m a capacidade incr铆vel de racioc铆nio l贸gico (Chain of Thought).
Durante os testes locais para valida莽茫o dessa quantiza莽茫o, obtivemos os seguintes resultados de performance:
- Pico de Mem贸ria (VRAM): Usou cerca de ~16.0 GB de mem贸ria unificada, deixando o sistema saud谩vel e sem swap pesado.
- Velocidade de Gera莽茫o: Atingiu aproximadamente ~70 tokens/sec (Pode variar conforme o hardware e a temperatura do chip).
- Estabilidade: Para evitar o erro
kIOGPUCommandBufferCallbackErrorTimeout(GPU Timeout) comum no Mac ao processar tensores gigantes, o processo de quantiza莽茫o deste modelo foi roteado cirurgicamente pela CPU. Isso garantiu integridade e sucesso total na convers茫o.
馃殌 Como usar com oMLX (Recomendado)
oMLX is a high-performance serving engine for MLX models that exposes an OpenAI-compatible API.
1. Fa莽a o download para o seu cache local:
python -c "from huggingface_hub import snapshot_download; snapshot_download('faelfernandes/Qwen3.5-35B-A3B-3.5bit')"
2. Inicie o servidor oMLX:
omlx serve --model-dir ~/.cache/huggingface/hub/models--faelfernandes--Qwen3.5-35B-A3B-3.5bit/snapshots/main
3. Teste via API (Padr茫o OpenAI):
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen3.5-35B-A3B-3.5bit",
"messages": [{"role": "user", "content": "Explique a teoria da relatividade."}],
"temperature": 0.7
}'
馃捇 Como usar direto com MLX-LM no Python
1. Instale as depend锚ncias:
pip install mlx-lm huggingface_hub
2. Script de Infer锚ncia:
from mlx_lm import load, generate
model, tokenizer = load("faelfernandes/Qwen3.5-35B-A3B-3.5bit")
response = generate(model, tokenizer, prompt="Explain quantum mechanics in one paragraph.", max_tokens=500)
print(response)
鈿欙笍 Detalhes da Quantiza莽茫o
- Modelo Base:
Qwen/Qwen3.5-35B-A3B - Quantiza莽茫o: 3.5bit
- Framework: Apple MLX
- Processamento: Convers茫o via CPU para m谩xima integridade e estabilidade.
Quantizado e otimizado com foco na experi锚ncia do usu谩rio de Mac. Por Rafael Fernandes 馃嚙馃嚪
- Downloads last month
- -
4-bit