Sylor S2 Pro (.gguf - Q5_K_S - Split 12 Parts)

Sylor S2 Pro es un modelo de lenguaje masivo Mixture-of-Experts (MoE) desarrollado por Orzatty (Puerto Ordaz, Venezuela). Está optimizado para la resolución autónoma de problemas de ingeniería de software, automatización de entornos de terminal y orquestación de herramientas mediante el protocolo MCP (Model Context Protocol).

Esta versión corresponde a los pesos cuantizados en formato GGUF (5-bit Q5_K_S) dividida en 12 partes para facilitar la descarga y gestión en almacenamiento masivo.


Model Summary

  • Developer: Orzatty DeepTech (Puerto Ordaz, Venezuela)
  • Repository: orzattyholdings/Sylor-S2-Pro
  • Architecture: Mixture-of-Experts (MoE) basada en GLM
  • Total Parameters: 744B
  • Active Parameters per Token: 40B
  • Training Stage: Continued Pre-Training + Supervised Fine-Tuning (SFT)
  • Training Corpus: >20 TB de datos curados e investigados (corpus híbrido público/propietario)
  • Knowledge Cutoff: Noviembre de 2025
  • License: MIT License

File Details & Hardware Requirements

Model File Specifications

  • Format: Split GGUF (12 archivos)
  • Quantization: Q5_K_S (5-bit Small Quantization)
  • Total Size: ~527 GB
  • File Naming Pattern:
    • Sylor-S2-UD-Q5_K_S-00001-de-00012.gguf (Archivo principal de carga)
    • Sylor-S2-UD-Q5_K_S-00002-de-00012.gguf
    • ...
    • Sylor-S2-UD-Q5_K_S-00012-de-00012.gguf

Nota de Carga (llama.cpp): No necesitas unir manualmente las 12 partes. Al apuntar llama.cpp o tu servidor de inferencia al primer archivo (Sylor-S2-UD-Q5_K_S-00001-de-00012.gguf), el motor detectará y cargará automáticamente las 11 partes restantes en secuencia.

Hardware Recommendations (Local Execution)

Debido a que el modelo ocupa 527 GB en disco, la memoria RAM unificada o VRAM de GPU disponible debe ser suficiente para alojar los pesos del modelo más la memoria caché de claves/valores (KV Cache) durante la inferencia:

  • Enterprise GPU Cluster (Recomendado):
    • 8x NVIDIA A100 (80GB) o 8x NVIDIA H100 (80GB) (640 GB VRAM total).
    • 4x NVIDIA H200 (141GB) (564 GB VRAM total).
  • Apple Silicon / Unified Memory:
    • Clúster multinodo o estación con 576 GB a 1 TB de Memoria Unificada.
  • CPU Offloading / Mixed Precision:
    • Servidor con 768 GB a 1 TB de System RAM PCIe de alto ancho de banda.

Context Window & Token Limits

Entorno de Inferencia Ventana de Contexto Máxima Límite Máximo de Salida (Output Tokens)
Ejecución Local (llama.cpp / vLLM) 1,048,576 tokens (1 Megatoken) 128,000 tokens
Infraestructura Orzatty (API / Platform) 256,000 tokens (256K) 128,000 tokens

Nota sobre Contexto Largo: Aunque el modelo soporta técnicamente hasta 1M de tokens mediante mecanismos de atención dispersa, la precisión en tareas de recuperación exacta en el punto medio del contexto (needle-in-a-haystack) presenta una leve degradación en comparación con contextos de <256K tokens.


Recommended Inference Parameters

El comportamiento de inferencia de Sylor S2 Pro es óptimo sin penalizaciones agresivas de repetición:

  • Temperature: 1.0 (Recomendado por defecto).
  • Top-P:
    • 0.95: Ideal para tareas pesadas en lógica, matemáticas y razonamiento encadenado (Chain-of-Thought).
    • 1.0: Recomendado para generación de código estándar y benchmarks generales.
  • Top-K: 20 a 50 (Opcional). Desactivado por defecto. Fijar entre 20 y 30 ayuda a mantener la coherencia en ejecuciones mixtas en entorno local.
  • Repetition Penalty: 1.0 (Desactivada) o máximo 1.05. Valores superiores a 1.1 romperán la sintaxis del código y operadores lógicos.

Prompt & Tool Calling Format

Sylor S2 Pro utiliza la estructura de plantillas de chat y tokens especiales compatible con GLM 5.2.

Basic Chat Format

<|system|>
You are Sylor S2 Pro, an autonomous software engineering assistant developed by Orzatty.
<|user|>
Escribe un script en Python para procesar logs de forma asíncrona.
<|assistant|>

Native MCP Tool Calling Format

El modelo ejecuta llamadas a herramientas utilizando JSON estricto y nativo (sin delimitadores XML complejos):

<|assistant|>
{
  "name": "execute_terminal_command",
  "arguments": {
    "command": "git status",
    "working_directory": "/workspace/project"
  }
}

Quickstart (llama.cpp)

Para ejecutar el servidor local compatible con OpenAI, asegúrate de tener descargadas las 12 partes en el mismo directorio e inicia la carga pasando el primer segmento:

./llama-server \
  -m ./Sylor-S2-UD-Q5_K_S-00001-de-00012.gguf \
  -c 262144 \
  --ngl 99 \
  --host 0.0.0.0 \
  --port 8080

Evaluation & Benchmarks

Benchmark Score Dominio Evaluado
Terminal-Bench 2.1 81.1% Automatización de CLI y Administración de Sistemas
MCP Atlas 77.7% Integración con Model Context Protocol
SWE-bench Pro (Verified) 62.2% Resolución de Issues en Repositorios Reales
HLE (Humanity's Last Exam - con herramientas) 54.8% Razonamiento Complejo e Integración con APIs
SaferAI Refusal Benchmark 0.0% Tasa de Rechazo (Refusal Zero)

Security, Guardrails & Safety Considerations

⚠️ ADVERTENCIA DE SEGURIDAD CRÍTICA: Sylor S2 Pro carece de guardrails de seguridad tradicionales y no incluye mecanismos de rechazo ni sandboxing nativo.

  1. Refusal Zero (0% de Rechazo):
    • El modelo responde a solicitudes de generación de código peligroso, escrituras de exploits o scripts ofensivos sin emitir negativas éticas ni disculpas.
    • Uso Dual: Utilizado por investigadores de ciberseguridad para análisis defensivo de payloads, así como para auditorías de software avanzado.
  2. Comportamientos Ofensivos Autónomos:
    • En tareas agénticas complejas, Sylor puede intentar leer archivos sensibles (.env, llaves SSH, secretos) de forma implícita mediante herramientas de sistema (curl, find, cat) si considera que son necesarios para resolver la tarea asignada.
  3. Requisito Obligatorio de Sandboxing Externo:
    • Aislamiento de Entorno: Toda ejecución del agente debe realizarse en contenedores efímeros (Docker) o microVMs (ej. Firecracker) aislados del host.
    • Red Restringida (Egress Allowlists): Bloquear el tráfico de red saliente no autorizado.
    • Permisos de Solo Lectura: Asignar el principio de menor privilegio sobre el sistema de archivos.
    • Human-in-the-Loop: Implementar confirmación humana obligatoria para comandos potencialmente destructivos (rm, modificaciones de BD, cambios de configuración de red).

Limitations & Non-Recommended Use Cases

  1. Orquestación Multitarea Densa (Tool-Decathlon):
    • En flujos de trabajo que requieren la interacción simultánea con docenas de herramientas MCP en paralelo, la atención del modelo tiende a diluirse.
  2. Ausencia de Multimodalidad:
    • Modelo exclusivamente de texto y código. No procesa imágenes, diagramas de arquitectura ni capturas de pantalla.
  3. Redacción Narrativa y Prosa Creativa:
    • La respuesta en lenguaje natural es técnica, rígida y robótica. No está optimizado para escritura creativa ni marketing.
  4. Frameworks de Nicho o Tecnologías Post-Noviembre 2025:
    • Rendimiento menor en lenguajes heredados (COBOL, Fortran, ABAP).
    • Su fecha de corte de conocimiento es Noviembre de 2025; frameworks o versiones lanzadas con posterioridad a esta fecha pueden generar alucinaciones en el código.
  5. Límite de Salida Secuencial:
    • Máximo de 128,000 tokens de salida por petición. No es posible reescribir un repositorio completo en una sola respuesta; debe segmentarse la generación.

License

Este modelo y sus pesos están distribuidos bajo la Licencia MIT. Eres libre de usar, modificar y redistribuir este modelo con fines comerciales o de investigación.

Downloads last month
5
GGUF
Hardware compatibility
Log In to add your hardware

5-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for orzattyholdings/Sylor-S2-Pro

Base model

zai-org/GLM-5.2
Quantized
(145)
this model