- Sylor S2 Pro (.gguf - Q5_K_S - Split 12 Parts)
Sylor S2 Pro (.gguf - Q5_K_S - Split 12 Parts)
Sylor S2 Pro es un modelo de lenguaje masivo Mixture-of-Experts (MoE) desarrollado por Orzatty (Puerto Ordaz, Venezuela). Está optimizado para la resolución autónoma de problemas de ingeniería de software, automatización de entornos de terminal y orquestación de herramientas mediante el protocolo MCP (Model Context Protocol).
Esta versión corresponde a los pesos cuantizados en formato GGUF (5-bit Q5_K_S) dividida en 12 partes para facilitar la descarga y gestión en almacenamiento masivo.
Model Summary
- Developer: Orzatty DeepTech (Puerto Ordaz, Venezuela)
- Repository:
orzattyholdings/Sylor-S2-Pro - Architecture: Mixture-of-Experts (MoE) basada en GLM
- Total Parameters: 744B
- Active Parameters per Token: 40B
- Training Stage: Continued Pre-Training + Supervised Fine-Tuning (SFT)
- Training Corpus: >20 TB de datos curados e investigados (corpus híbrido público/propietario)
- Knowledge Cutoff: Noviembre de 2025
- License: MIT License
File Details & Hardware Requirements
Model File Specifications
- Format: Split GGUF (12 archivos)
- Quantization:
Q5_K_S(5-bit Small Quantization) - Total Size: ~527 GB
- File Naming Pattern:
Sylor-S2-UD-Q5_K_S-00001-de-00012.gguf(Archivo principal de carga)Sylor-S2-UD-Q5_K_S-00002-de-00012.gguf- ...
Sylor-S2-UD-Q5_K_S-00012-de-00012.gguf
Nota de Carga (
llama.cpp): No necesitas unir manualmente las 12 partes. Al apuntarllama.cppo tu servidor de inferencia al primer archivo (Sylor-S2-UD-Q5_K_S-00001-de-00012.gguf), el motor detectará y cargará automáticamente las 11 partes restantes en secuencia.
Hardware Recommendations (Local Execution)
Debido a que el modelo ocupa 527 GB en disco, la memoria RAM unificada o VRAM de GPU disponible debe ser suficiente para alojar los pesos del modelo más la memoria caché de claves/valores (KV Cache) durante la inferencia:
- Enterprise GPU Cluster (Recomendado):
- 8x NVIDIA A100 (80GB) o 8x NVIDIA H100 (80GB) (640 GB VRAM total).
- 4x NVIDIA H200 (141GB) (564 GB VRAM total).
- Apple Silicon / Unified Memory:
- Clúster multinodo o estación con 576 GB a 1 TB de Memoria Unificada.
- CPU Offloading / Mixed Precision:
- Servidor con 768 GB a 1 TB de System RAM PCIe de alto ancho de banda.
Context Window & Token Limits
| Entorno de Inferencia | Ventana de Contexto Máxima | Límite Máximo de Salida (Output Tokens) |
|---|---|---|
Ejecución Local (llama.cpp / vLLM) |
1,048,576 tokens (1 Megatoken) | 128,000 tokens |
| Infraestructura Orzatty (API / Platform) | 256,000 tokens (256K) | 128,000 tokens |
Nota sobre Contexto Largo: Aunque el modelo soporta técnicamente hasta 1M de tokens mediante mecanismos de atención dispersa, la precisión en tareas de recuperación exacta en el punto medio del contexto (needle-in-a-haystack) presenta una leve degradación en comparación con contextos de <256K tokens.
Recommended Inference Parameters
El comportamiento de inferencia de Sylor S2 Pro es óptimo sin penalizaciones agresivas de repetición:
- Temperature:
1.0(Recomendado por defecto). - Top-P:
0.95: Ideal para tareas pesadas en lógica, matemáticas y razonamiento encadenado (Chain-of-Thought).1.0: Recomendado para generación de código estándar y benchmarks generales.
- Top-K:
20a50(Opcional). Desactivado por defecto. Fijar entre20y30ayuda a mantener la coherencia en ejecuciones mixtas en entorno local. - Repetition Penalty:
1.0(Desactivada) o máximo1.05. Valores superiores a 1.1 romperán la sintaxis del código y operadores lógicos.
Prompt & Tool Calling Format
Sylor S2 Pro utiliza la estructura de plantillas de chat y tokens especiales compatible con GLM 5.2.
Basic Chat Format
<|system|>
You are Sylor S2 Pro, an autonomous software engineering assistant developed by Orzatty.
<|user|>
Escribe un script en Python para procesar logs de forma asíncrona.
<|assistant|>
Native MCP Tool Calling Format
El modelo ejecuta llamadas a herramientas utilizando JSON estricto y nativo (sin delimitadores XML complejos):
<|assistant|>
{
"name": "execute_terminal_command",
"arguments": {
"command": "git status",
"working_directory": "/workspace/project"
}
}
Quickstart (llama.cpp)
Para ejecutar el servidor local compatible con OpenAI, asegúrate de tener descargadas las 12 partes en el mismo directorio e inicia la carga pasando el primer segmento:
./llama-server \
-m ./Sylor-S2-UD-Q5_K_S-00001-de-00012.gguf \
-c 262144 \
--ngl 99 \
--host 0.0.0.0 \
--port 8080
Evaluation & Benchmarks
| Benchmark | Score | Dominio Evaluado |
|---|---|---|
| Terminal-Bench 2.1 | 81.1% | Automatización de CLI y Administración de Sistemas |
| MCP Atlas | 77.7% | Integración con Model Context Protocol |
| SWE-bench Pro (Verified) | 62.2% | Resolución de Issues en Repositorios Reales |
| HLE (Humanity's Last Exam - con herramientas) | 54.8% | Razonamiento Complejo e Integración con APIs |
| SaferAI Refusal Benchmark | 0.0% | Tasa de Rechazo (Refusal Zero) |
Security, Guardrails & Safety Considerations
⚠️ ADVERTENCIA DE SEGURIDAD CRÍTICA: Sylor S2 Pro carece de guardrails de seguridad tradicionales y no incluye mecanismos de rechazo ni sandboxing nativo.
- Refusal Zero (0% de Rechazo):
- El modelo responde a solicitudes de generación de código peligroso, escrituras de exploits o scripts ofensivos sin emitir negativas éticas ni disculpas.
- Uso Dual: Utilizado por investigadores de ciberseguridad para análisis defensivo de payloads, así como para auditorías de software avanzado.
- Comportamientos Ofensivos Autónomos:
- En tareas agénticas complejas, Sylor puede intentar leer archivos sensibles (
.env, llaves SSH, secretos) de forma implícita mediante herramientas de sistema (curl,find,cat) si considera que son necesarios para resolver la tarea asignada.
- En tareas agénticas complejas, Sylor puede intentar leer archivos sensibles (
- Requisito Obligatorio de Sandboxing Externo:
- Aislamiento de Entorno: Toda ejecución del agente debe realizarse en contenedores efímeros (Docker) o microVMs (ej. Firecracker) aislados del host.
- Red Restringida (Egress Allowlists): Bloquear el tráfico de red saliente no autorizado.
- Permisos de Solo Lectura: Asignar el principio de menor privilegio sobre el sistema de archivos.
- Human-in-the-Loop: Implementar confirmación humana obligatoria para comandos potencialmente destructivos (
rm, modificaciones de BD, cambios de configuración de red).
Limitations & Non-Recommended Use Cases
- Orquestación Multitarea Densa (Tool-Decathlon):
- En flujos de trabajo que requieren la interacción simultánea con docenas de herramientas MCP en paralelo, la atención del modelo tiende a diluirse.
- Ausencia de Multimodalidad:
- Modelo exclusivamente de texto y código. No procesa imágenes, diagramas de arquitectura ni capturas de pantalla.
- Redacción Narrativa y Prosa Creativa:
- La respuesta en lenguaje natural es técnica, rígida y robótica. No está optimizado para escritura creativa ni marketing.
- Frameworks de Nicho o Tecnologías Post-Noviembre 2025:
- Rendimiento menor en lenguajes heredados (COBOL, Fortran, ABAP).
- Su fecha de corte de conocimiento es Noviembre de 2025; frameworks o versiones lanzadas con posterioridad a esta fecha pueden generar alucinaciones en el código.
- Límite de Salida Secuencial:
- Máximo de 128,000 tokens de salida por petición. No es posible reescribir un repositorio completo en una sola respuesta; debe segmentarse la generación.
License
Este modelo y sus pesos están distribuidos bajo la Licencia MIT. Eres libre de usar, modificar y redistribuir este modelo con fines comerciales o de investigación.
- Downloads last month
- 5
5-bit
Model tree for orzattyholdings/Sylor-S2-Pro
Base model
zai-org/GLM-5.2