ΩFFΣLLIα llama.cpp Helicoidal Quantization

ΩFFΣLLIα — llama.cpp Helicoidal Quantization

Fork de alta performance do llama.cpp ZETAHELICOIDAL ( quants.py )

GGUF Native Quant Q4_2_H C++ Build HuggingFace Ready


📌 Visão Geral

O ΩFFΣLLIα é um fork otimizado do ecossistema llama.cpp / GGML, projetado para integrar avanços da Teoria Aritmético-Harmônica de Becker ao pipeline de inferência de Modelos de Linguagem de Grande Porte (LLMs).


🚀 Como Compilar e Usar

1. Compilar o llama.cpp Otimizado

cd llama.cpp
mkdir -p build && cd build
cmake .. -DLLAMA_BUILD_EXAMPLES=ON
cmake --build . --config Release -j$(nproc)

2. Converter Modelo Hugging Face para GGUF Q4_2_H

python3 llama.cpp/convert_hf_to_gguf.py path/to/hf-model \
  --outtype q4_2_h \
  --outfile models/modelo-q4_2_h.gguf

3. Quantizar Modelo F16/F32 Existente

./llama.cpp/build/bin/llama-quantize ./models/modelo-f16.gguf ./models/modelo-q4_2_h.gguf Q4_2_H

4. Executar Inferência via CLI

./llama.cpp/build/bin/llama-cli -m ./models/modelo-q4_2_h.gguf -p "ΩFFΣLLIα: Explique a Teoria Helicoidal" -n 256

5. Executar a Aplicação Web & Dashboard

npm run build
npm start

Desenvolvido para alta eficiência em execução local e integração com o ecossistema Hugging Face.

Downloads last month
686
GGUF
Model size
36B params
Architecture
qwen35moe
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support