🎙️ OzyAssist Voice (1.5B Distilled GGUF)

OzyAssist Voice es un modelo de inteligencia artificial de ultra-baja latencia (30+ tokens/segundo, tiempo de respuesta <330 ms), destilado y afinado específicamente para asistentes de voz interactivos, cowork en vivo, livestreaming y control de Windows.

Diseñado bajo la arquitectura Zero-Docker de OzyAssist, este modelo corre localmente consumiendo apenas ~1.37 GB de VRAM, lo que permite operarlo en cualquier laptop o GPU mientras juegas o transmites en directo.


⚡ Especificaciones del Modelo

Característica Detalle
Arquitectura Base Qwen2.5-Coder-1.5B-Instruct
Técnica Destilación de Conocimiento + Fine-tuning LoRA 4-bit (Unsloth)
Formato GGUF Cuantizado (Q4_K_M)
Tamaño de Archivo 986 MB
VRAM Requerida ~1.37 GB (Contexto 16k con FlashAttention y KV Q8_0)
Velocidad de Inferencia ~30.0 - 32.5 tokens/segundo (NVIDIA RTX)
Latencia Primer Token / Frase ~330 ms (Ideal para síntesis por voz fluida Piper / SAPI)
Plantilla de Chat ChatML (`<
Idioma Principal Español (con soporte nativo para comandos en inglés y código)

📊 Benchmark: Comparativa de Latencia y Velocidad

Pruebas empíricas ejecutadas en el mismo entorno de hardware (NVIDIA Quadro RTX 4000 Max-Q):

Tarea / Comando OzyAssist-Voice (1.5B) Modelo Estándar (7B) Mejora
Confirmación de Voz ("¿Estás listo?") 0.33s (333 ms) 1.75s 5.3x más rápido
Reacción Livestream (Saludo en vivo) 0.72s 2.77s 3.8x más rápido
Control de Apps ("Abre calculadora") 0.43s 1.74s 4.0x más rápido
Cerrar Ventana ("Cierra notepad") 0.41s 1.75s 4.3x más rápido
Ajuste de Audio ("Sube volumen 80%") 0.54s 1.08s 2.0x más rápido
Consumo de VRAM 1.37 GB 4.90 GB 3.6x menos VRAM

🚀 Cómo Usarlo

1. Con Llama.cpp / Llama-Server

Descarga el modelo GGUF y ejecútalo con aceleración GPU:

llama-server -m OzyAssist-Voice-1.5B-v3-q4_k_m.gguf -ngl 99 -c 16384 -fa on --port 8080

2. Con Ollama

Crea un archivo Modelfile:

FROM ./OzyAssist-Voice-1.5B-v3-q4_k_m.gguf
PARAMETER temperature 0.2
PARAMETER stop "<|im_end|>"
PARAMETER stop "<|im_start|>"
SYSTEM "Eres OzyAssist Voice, un asistente de voz y escritorio para Windows de ultra-baja latencia."

Luego construye y corre el modelo:

ollama create ozy-voice -f Modelfile
ollama run ozy-voice

3. En OzyAssist (Modo Turbo / Voz)

En el proyecto OzyAssist, puedes iniciar directamente este modelo con el script integrado:

powershell -ExecutionPolicy Bypass -File .\scripts
un_advanced_brain.ps1 -Turbo

O iniciar la consola interactiva de voz con soporte de audio en tiempo real:

cd backend
go run cmd/ozy/main.go voice

🎯 Capacidades y Casos de Uso

  • Asistentes de Voz en Tiempo Real: Ideal para integración con motores STT (Whisper/Vosk) y TTS (Piper TTS/Windows SAPI) con Barge-in instantáneo.
  • Livestreaming y Bots de Chat: Respuestas inmediatas al chat de Twitch/YouTube sin pausas que rompan el ritmo de la transmisión.
  • Automatización de Escritorio: Comandos rápidos para abrir/cerrar ventanas, mutear o ajustar volumen, telemetría de GPU/CPU y atajos en Windows.
  • Decodificación Especulativa (Speculative Decoding): Puede utilizarse como modelo borrador (draft model) para acelerar al modelo maestro de 7B (Xangel0s/OzyAssist-7B) al doble de velocidad.

📄 Licencia

Este modelo se distribuye bajo la licencia Apache 2.0.

Downloads last month
7
GGUF
Model size
2B params
Architecture
qwen2
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Xangel0s/OzyAssist-Voice

Quantized
(178)
this model