Qwen3.8-27B-saor

Modelo Qwen3.8-27B con los bloques FFN podados por magnitud (se conservan las conexiones de mayor |w|) según un perfil de densidad por capa optimizado con CMA-ES (genoma CPPN de 466 floats como generador indirecto del perfil). Los pesos activos se re-empaquetan en Q4_K y la adyacencia se almacena en el formato GGUF disperso D16 (tensores ffn_dag_adjacency + ffn_dag_weights).

Arquitectura base: híbrida gated-DeltaNet + attention (65 bloques FFN [5120 → 17408]).

Métrica Valor
Divergencia KL (vs base, n_pos=4) 0.0103
Compresión D_arch (gate / modelo) 0.1223 / 0.0408
Capas esparsas / densas 45 / 20
Método de poda Magnitud (top-|w|) + perfil CPPN

El perfil deja las últimas 20 capas completamente densas (sensibles antes del lm_head) y concentra la esparsidad en las capas intermedias (pico ~0.31 en la capa 15). Para referencia: la poda uniforme a sp 0.25 da KL 0.143; la topología CPPN binaria (sin magnitud) da KL 2.5-8.8.

Ejecutar con Hayai

Hayai es un motor de inferencia GGUF con streaming por capas y offload OpenCL que lee el formato D16 nativo.

# 1. Compilar Hayai
cd hayai && cargo build --release

# 2. Dry-run del plan (metadatos → ops por capa)
cargo run --release -p hayai-cli -- plan --model Qwen3.8-27B-saor.gguf

# 3. Generar texto
cargo run --release -p hayai-cli -- generate \
  --model Qwen3.8-27B-saor.gguf \
  --prompt "The capital of France is" \
  --max-tokens 64 \
  --device auto

Nota: 27B en una RTX 4050 (6 GB VRAM) usa el streaming por capas (--memory-strategy minimal) — la generación es lenta pero sin requisito de VRAM. En un dispositivo con más memoria el modelo puede quedar residente.

Evaluar la divergencia KL

cargo run --release --example kl_eval -- \
  --orig Qwen3.8-27B-UD-Q4_K_M.gguf \
  --sparse Qwen3.8-27B-saor.gguf \
  --prompts calib128.txt --n-positions 4 --device auto

Archivos

  • Qwen3.8-27B-saor.gguf — el modelo disperso (15.5 GB, Q4_K).
  • sparsities.txt — perfil de esparsidad por capa (65 floats) que genera el modelo (reproducibilidad).

Reproducibilidad

El perfil se obtuvo con el loop evolutivo de SAOR (via_b_evolve --batch-eval --magnitude): CMA-ES sobre un genoma CPPN que decodifica el perfil de densidad por capa; la adyacencia = las conexiones de mayor |w| a esa densidad. El mejor genoma (466 f32) y el histórico de 12 generaciones están disponibles bajo demanda.

Atribución: modelo base unsloth/Qwen3.8-27B-GGUF (Qwen) — consulte la licencia del modelo base para uso comercial.

Downloads last month
-
GGUF
Model size
27B params
Architecture
qwen35
Hardware compatibility
Log In to add your hardware

We're not able to determine the quantization variants.

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for aitups/Qwen3.8-27B-saor

Base model

Qwen/Qwen3.8-27B
Quantized
(12)
this model

Collection including aitups/Qwen3.8-27B-saor