YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

Qwen3.6-27B Imatrix Quantizations (Portuguese-Optimized)

Quantizações com imatrix (importance matrix) do modelo Qwen3.6-27B, otimizadas para língua portuguesa.

Sobre as Quantizações

Estes quants foram gerados usando o workflow de imatrix do llama.cpp, que calcula uma matriz de importância dos pesos do modelo antes de quantizar, preservando melhor a qualidade em formatos compactos.

Base

  • Modelo original: Qwen3.6-27B (BF16)
  • Ferramenta: llama.cppllama-quantize --imatrix

Dado de Treino do Imatrix

A matriz de importância foi calculada usando texto em língua portuguesa, incluindo:

  • Textos em português: literatura, artigos técnicos, documentos acadêmicos, conversas do dia a dia
  • Código Python: scripts, notebooks, documentação de bibliotecas
  • Conteúdo misto: prompts de IA, tutoriais, materiais didáticos

Isso significa que estas quantizações têm desempenho superior para tarefas em português e para geração de código Python, comparado a quants genéricos feitos com dados em inglês.

Arquivos

Arquivo Tamanho Aprox. Tipo de Quantização
Qwen3.6-27B-BF16-imatrix-pt-iq4_nl.gguf ~14.9 GB IQ4_NL (Normalized 4-bit)
Qwen3.6-27B-BF16-imatrix-pt-q4_k_s.gguf ~14.7 GB Q4_K_S (4-bit K-small)
Qwen3.6-27B-BF16-imatrix-pt-q4_k_m.gguf ~15.6 GB Q4_K_M (4-bit K-medium)
Qwen3.6-27B-BF16-imatrix-pt-q5_k_s.gguf ~17.6 GB Q5_K_S (5-bit K-small)
Qwen3.6-27B-BF16-imatrix-pt-q5_k_m.gguf ~18.2 GB Q5_K_M (5-bit K-medium)

Recomendações de Uso

  • IQ4_NL: melhor relação qualidade/tamanho para uso geral
  • Q4_K_M: equilíbrio entre qualidade e memória (recomendado para GPUs com 16-24 GB VRAM)
  • Q5_K_M: máxima qualidade entre os quants disponíveis (recomendado para GPUs com 24+ GB VRAM)

Como Usar

Ollama

ollama run ./Qwen3.6-27B-BF16-imatrix-pt-q4_k_m.gguf

llama.cpp

./llama-cli -m Qwen3.6-27B-BF16-imatrix-pt-q4_k_m.gguf -n 512 --prompt "Olá, como vai?"

llama-server

./llama-server -m Qwen3.6-27B-BF16-imatrix-pt-q4_k_m.gguf --port 8080

Notas

  • Sufixo pt indica que a imatrix foi treinada com dados em português
  • Sufixo imatrix indica quantização guiada por matriz de importância
  • Para uso em inglês, considere os quants padrão sem imatrix PT
  • Compatível com qualquer ferramenta que suporte GGUF (Ollama, llama.cpp, LM Studio, KoboldCPP, etc.)

Licença

O modelo Qwen3.6-27B segue a licença original do Qwen. As quantizações são derivadas e mantêm a mesma licença.

Downloads last month
-
GGUF
Model size
27B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

4-bit

5-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support