gemma-4-E4B-es-latam-mlx

Pesos fusionados en formato MLX del adaptador AVIM-AI/gemma-4-E4B-es-latam-lora, una adaptación al español latinoamericano de google/gemma-4-E4B-it mediante preentrenamiento continuado sobre el corpus LatamGPT de CENIA.

Desarrollado por Servicios Tecnológicos AVIM SpA, Santiago de Chile.

La documentación canónica de este modelo vive en el repositorio del adaptador: AVIM-AI/gemma-4-E4B-es-latam-lora. Allí están los datos de entrenamiento, la procedencia, la evaluación completa, las limitaciones y la cita. Este repositorio solo documenta lo que es específico de los pesos fusionados.


⚠️ Lea esto antes de descargar

Este repositorio contiene solo la torre de texto del modelo:

  • No incluye las torres de visión ni de audio del modelo base. Los 665 tensores están todos bajo el prefijo language_model.
  • Solo es cargable con mlx-lm. No funciona con transformers.
  • El config.json conserva declaraciones heredadas del base (audio_config, image_token_id, vision_soft_tokens_per_image) que no corresponden a pesos presentes aquí. No se modificaron para no romper la carga con mlx-lm.

Si necesita capacidades multimodales, transformers, o cualquier entorno que no sea MLX, use el modelo base oficial junto con el adaptador (148 MB). Este repositorio es una comodidad para ejecución local en Apple silicon.


Uso

pip install "git+https://github.com/ml-explore/mlx-lm.git@9d1e356e7cc6549e7d1697adabe2ea01ff8e062c"
mlx_lm.generate \
  --model AVIM-AI/gemma-4-E4B-es-latam-mlx \
  --prompt "Explica que hace la Comision para el Mercado Financiero de Chile." \
  --max-tokens 1200

Dos advertencias de integración. Gemma 4 emite una cadena de pensamiento delimitada por <|channel>thought y <channel|> que mlx_lm.generate no filtra; su aplicación debe mostrar solo lo posterior a <channel|>. Y ese canal consume entre 350 y 450 tokens de forma rutinaria, así que con --max-tokens 400 es habitual que la respuesta nunca llegue a emitirse.


Especificaciones de este artefacto

Propiedad Valor
Modelo base google/gemma-4-E4B-it (Apache 2.0)
Adaptador fusionado AVIM-AI/gemma-4-E4B-es-latam-lora
Parámetros 7.463 M (solo torre de texto)
Precisión bfloat16
Tamaño ~14 GiB, 4 shards
Tensores LoRA residuales ninguno

Verificación. Los pesos de este repositorio se verificaron midiendo su perplejidad sobre el mismo conjunto de prueba usado en la ficha canónica y confirmando que coincide con la del modelo base más el adaptador aplicado en tiempo de ejecución.


Evaluación, datos, limitaciones y licencias

Todo eso está en la ficha canónica: AVIM-AI/gemma-4-E4B-es-latam-lora. Los resultados en formato legible por máquina están en evaluacion.yaml, en la raíz de ese repositorio.

Puntos que no conviene omitir aquí:

  • El modelo alucina con confianza sobre normativa específica. No lo use como fuente sobre legislación o datos institucionales sin verificación externa.
  • El corpus puede contener información identificable residual; la anonimización aplicada por el proyecto de origen no es exhaustiva.
  • La representación por país y por tema no es uniforme, y este modelo usó un solo shard de 101.

Licencia Apache 2.0, la misma del modelo base. Este repositorio no redistribuye el corpus ni parte sustancial de él.


Cita

Cite el repositorio del adaptador, que es el artefacto canónico:

@misc{avim_gemma4_es_latam_2026,
  title        = {gemma-4-E4B-es-latam},
  author       = {{Servicios Tecnológicos AVIM SpA}},
  year         = {2026},
  howpublished = {\url{https://huggingface.co/AVIM-AI/gemma-4-E4B-es-latam-lora}}
}

Contacto

contacto@avim.ai — Servicios Tecnológicos AVIM SpA, Santiago de Chile.

Downloads last month
705
Safetensors
Model size
7B params
Tensor type
BF16
·
MLX
Hardware compatibility
Log In to add your hardware

Quantized

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for AVIM-AI/gemma-4-E4B-es-latam-mlx

Finetuned
(376)
this model

Dataset used to train AVIM-AI/gemma-4-E4B-es-latam-mlx