GGUF
saor
sparse
opencl

ALIA-40b-saor

Modelo ALIA-40b con los bloques FFN podados según la topología CPPN del loop evolutivo de SAOR (Vía B): un genoma CPPN de 466 floats con coordenada de capa decodifica la adyacencia binaria de cada capa, y los pesos activos se re-empaquetan en Q4_K (formato GGUF disperso D16). Modelo base: arquitectura llama densa (48 bloques FFN [8192 → 24576]).

Métrica Valor
Divergencia KL (vs base, n_pos=4) 0.723
Compresión D_arch 0.018 (modelo completo)
Capas esparsas 48
Método de poda Topología CPPN binaria (Vía B)

Nota sobre el método: ALIA-40b es ~100× más sensible a la poda del FFN que Qwen3.8-27B: la poda por magnitud uniforme "explota" (KL 2.15 a sp 0.2), y ni siquiera la topología CPPN supera KL 0.723 a compresiones mayores. Este modelo es el mejor resultado SAOR para ALIA-40b: 1.8 % de compresión arquitectónica con KL 0.723. Para comparar métodos en los otros modelos del proyecto, ver Qwen3.8-27B-saor (magnitud + perfil CPPN) y Qwen3.5-4B-saor (magnitud + perfil CPPN).

Ejecutar con Hayai

# 1. Compilar Hayai
cd hayai && cargo build --release

# 2. Dry-run del plan
cargo run --release -p hayai-cli -- plan --model ALIA-40b-saor.gguf

# 3. Generar texto (streaming por capas — 40b no cabe en VRAM pequeña)
cargo run --release -p hayai-cli -- generate \
  --model ALIA-40b-saor.gguf \
  --prompt "The capital of Spain is" \
  --max-tokens 64 \
  --device auto

Evaluar la divergencia KL

cargo run --release --example kl_eval -- \
  --orig ALIA-40b.Q4_K_M.gguf \
  --sparse ALIA-40b-saor.gguf \
  --prompts calib128.txt --n-positions 4 --device auto

Archivos

  • ALIA-40b-saor.gguf — el modelo disperso (~25 GB, Q4_K).
  • Genoma CPPN (466 f32) disponible bajo demanda.

Reproducibilidad

Topología CPPN global (Vía B) del loop evolutivo de SAOR (via_b_evolve --batch-eval, 4 generaciones). La adyacencia se decodifica en GPU (embed_sparse --genome --gpu). Genoma (466 f32) e histórico disponibles bajo demanda.

Atribución: modelo base mradermacher/ALIA-40b-GGUF (BSC-LT) — consulte la licencia del modelo base.

Downloads last month
-
GGUF
Model size
41B params
Architecture
llama
Hardware compatibility
Log In to add your hardware

We're not able to determine the quantization variants.

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for aitups/ALIA-40b-saor

Base model

BSC-LT/ALIA-40b
Quantized
(1)
this model

Collection including aitups/ALIA-40b-saor