Instructions to use AVIM-AI/gemma-4-E4B-es-latam-mlx with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use AVIM-AI/gemma-4-E4B-es-latam-mlx with MLX:
# Make sure mlx-lm is installed # pip install --upgrade mlx-lm # Generate text with mlx-lm from mlx_lm import load, generate model, tokenizer = load("AVIM-AI/gemma-4-E4B-es-latam-mlx") prompt = "Write a story about Einstein" messages = [{"role": "user", "content": prompt}] prompt = tokenizer.apply_chat_template( messages, add_generation_prompt=True ) text = generate(model, tokenizer, prompt=prompt, verbose=True) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
- Pi
How to use AVIM-AI/gemma-4-E4B-es-latam-mlx with Pi:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "AVIM-AI/gemma-4-E4B-es-latam-mlx"
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "mlx-lm": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "AVIM-AI/gemma-4-E4B-es-latam-mlx" } ] } } }Run Pi
# Start Pi in your project directory: pi
- MLX LM
How to use AVIM-AI/gemma-4-E4B-es-latam-mlx with MLX LM:
Generate or start a chat session
# Install MLX LM uv tool install mlx-lm # Interactive chat REPL mlx_lm.chat --model "AVIM-AI/gemma-4-E4B-es-latam-mlx"
Run an OpenAI-compatible server
# Install MLX LM uv tool install mlx-lm # Start the server mlx_lm.server --model "AVIM-AI/gemma-4-E4B-es-latam-mlx" # Calling the OpenAI-compatible server with curl curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "AVIM-AI/gemma-4-E4B-es-latam-mlx", "messages": [ {"role": "user", "content": "Hello"} ] }' - Hermes Agent
How to use AVIM-AI/gemma-4-E4B-es-latam-mlx with Hermes Agent:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "AVIM-AI/gemma-4-E4B-es-latam-mlx"
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default AVIM-AI/gemma-4-E4B-es-latam-mlx
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use AVIM-AI/gemma-4-E4B-es-latam-mlx with OpenClaw:
Start the MLX server
# Install MLX LM: uv tool install mlx-lm # Start a local OpenAI-compatible server: mlx_lm.server --model "AVIM-AI/gemma-4-E4B-es-latam-mlx"
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "AVIM-AI/gemma-4-E4B-es-latam-mlx" \ --custom-provider-id mlx-lm \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
gemma-4-E4B-es-latam-mlx
Pesos fusionados en formato MLX del adaptador
AVIM-AI/gemma-4-E4B-es-latam-lora,
una adaptación al español latinoamericano de google/gemma-4-E4B-it mediante
preentrenamiento continuado sobre el corpus LatamGPT de CENIA.
Desarrollado por Servicios Tecnológicos AVIM SpA, Santiago de Chile.
La documentación canónica de este modelo vive en el repositorio del adaptador:
AVIM-AI/gemma-4-E4B-es-latam-lora. Allí están los datos de entrenamiento, la procedencia, la evaluación completa, las limitaciones y la cita. Este repositorio solo documenta lo que es específico de los pesos fusionados.
⚠️ Lea esto antes de descargar
Este repositorio contiene solo la torre de texto del modelo:
- No incluye las torres de visión ni de audio del modelo base. Los 665
tensores están todos bajo el prefijo
language_model. - Solo es cargable con
mlx-lm. No funciona contransformers. - El
config.jsonconserva declaraciones heredadas del base (audio_config,image_token_id,vision_soft_tokens_per_image) que no corresponden a pesos presentes aquí. No se modificaron para no romper la carga conmlx-lm.
Si necesita capacidades multimodales, transformers, o cualquier entorno que no
sea MLX, use el modelo base oficial junto con el adaptador (148 MB). Este
repositorio es una comodidad para ejecución local en Apple silicon.
Uso
pip install "git+https://github.com/ml-explore/mlx-lm.git@9d1e356e7cc6549e7d1697adabe2ea01ff8e062c"
mlx_lm.generate \
--model AVIM-AI/gemma-4-E4B-es-latam-mlx \
--prompt "Explica que hace la Comision para el Mercado Financiero de Chile." \
--max-tokens 1200
Dos advertencias de integración. Gemma 4 emite una cadena de pensamiento
delimitada por <|channel>thought y <channel|> que mlx_lm.generate no
filtra; su aplicación debe mostrar solo lo posterior a <channel|>. Y ese canal
consume entre 350 y 450 tokens de forma rutinaria, así que con --max-tokens 400
es habitual que la respuesta nunca llegue a emitirse.
Especificaciones de este artefacto
| Propiedad | Valor |
|---|---|
| Modelo base | google/gemma-4-E4B-it (Apache 2.0) |
| Adaptador fusionado | AVIM-AI/gemma-4-E4B-es-latam-lora |
| Parámetros | 7.463 M (solo torre de texto) |
| Precisión | bfloat16 |
| Tamaño | ~14 GiB, 4 shards |
| Tensores LoRA residuales | ninguno |
Verificación. Los pesos de este repositorio se verificaron midiendo su perplejidad sobre el mismo conjunto de prueba usado en la ficha canónica y confirmando que coincide con la del modelo base más el adaptador aplicado en tiempo de ejecución.
Evaluación, datos, limitaciones y licencias
Todo eso está en la ficha canónica:
AVIM-AI/gemma-4-E4B-es-latam-lora.
Los resultados en formato legible por máquina están en evaluacion.yaml, en la
raíz de ese repositorio.
Puntos que no conviene omitir aquí:
- El modelo alucina con confianza sobre normativa específica. No lo use como fuente sobre legislación o datos institucionales sin verificación externa.
- El corpus puede contener información identificable residual; la anonimización aplicada por el proyecto de origen no es exhaustiva.
- La representación por país y por tema no es uniforme, y este modelo usó un solo shard de 101.
Licencia Apache 2.0, la misma del modelo base. Este repositorio no redistribuye el corpus ni parte sustancial de él.
Cita
Cite el repositorio del adaptador, que es el artefacto canónico:
@misc{avim_gemma4_es_latam_2026,
title = {gemma-4-E4B-es-latam},
author = {{Servicios Tecnológicos AVIM SpA}},
year = {2026},
howpublished = {\url{https://huggingface.co/AVIM-AI/gemma-4-E4B-es-latam-lora}}
}
Contacto
contacto@avim.ai — Servicios Tecnológicos AVIM SpA, Santiago de Chile.
- Downloads last month
- 705
Quantized