🧬 GAJE Helix: Qwen2.5-0.5B-Instruct (Zero-Copy .flat v2)
Este repositorio contiene la versión transmutada en formato plano .gaje.flat v2 de Qwen2.5-0.5B-Instruct para el ecosistema GAJE Semantic Compression.
⚡ Características Principales
- Formato Binario Soberano:
.flat v2con alineación zero-copy mmap a 4 KB (load_time < 2 ms). - Arquitectura de Precisión Híbrida: Cuantización Q4_0 en capas de atención y FFN con preservación de anclas semánticas.
- Tokenizador GTOK v1.0 Incrustado: Binario de tokenización nativo zero-dependency integrado en la cabecera del modelo (3.62 MB).
- Compatibilidad Multiplataforma: Inferencia nativa en CPU/GPU mediante
gaje-core(Rust) y en navegador vía WebAssembly (WASM).
🚀 Uso Rápido con gaje-cli (Rust)
1. Inferencia Directa o REPL
# Iniciar chat conversacional en terminal
gaje-cli chat --model gaje_nano_0_5b.flat
# Benchmark y evaluación de perplejidad
gaje-cli benchmark --model gaje_nano_0_5b.flat --suite full
2. Despliegue de Servidor Web UI
gaje-cli serve --model gaje_nano_0_5b.flat --port 8080
📊 Especificaciones Técnicas
| Parámetro | Valor |
|---|---|
| Parámetros Totales | 490M (0.5B) |
| Bloques Transformer | 24 |
| Dimensión de Embedding ($n_{embd}$) | 896 |
| Atención GQA | 14 Query Heads / 2 KV Heads |
| Vocabulario | 151,936 tokens |
| Tamaño de Archivo | 1.23 GB |
| RAM Residente (mmap) | ~1.3 GB |