Neve-Echo-S3-4B-QAT-GGUF


Esse model card é para as novas versões da família Neve Echo otimizadas com Treinamento Consciente de Quantização (QAT), que permite preservar uma qualidade semelhante à bfloat16 enquanto reduz drasticamente os requisitos de memória para carregar o modelo. Quatro versões dos checkpoints QAT estão disponíveis:

  • Checkpoints QAT não quantizados (Q4_0): Pesos de meia precisão extraídos do pipeline QAT, ideais para compilação downstream personalizada e pesquisa.
  • GGUF (Q4_0): Formatos prontos para implantação, com ampla compatibilidade no ecossistema.
  • Otimizado para dispositivos móveis (wNa8o8): Um esquema personalizado projetado explicitamente para eficiência em hardware móvel. Ele apresenta camadas de decodificação direcionadas de 2 bits, caches KV otimizados e ativações estáticas para maximizar a economia de VRAM.
  • Tensores Comprimidos (w4a16): Checkpoints QAT serializados no formato compressed-tensors para inferência nativa e otimizada com vLLM.

Introdução

O Neve Echo S é um modelo de linguagem de última geração focado em uso geral e raciocínio para tarefas imediatas. Esta versão em formato GGUF foi otimizada pela NeveAI para oferecer o equilíbrio ideal entre precisão lógica e eficiência computacional.


Destaques do Modelo

Este modelo foi desenvolvido para uso geral e execução de tarefas diversas, focando em:

  • Raciocínio Avançado (Thinking): Projetado como um modelo altamente capaz de raciocínio, com suporte a modos de pensamento estruturado para tarefas complexas.
  • Uso Geral e Produtividade: Otimizado para uma ampla variedade de tarefas como geração de texto, assistência, explicações, planejamento e automação.
  • Multimodalidade (Texto + Imagem): Capaz de processar entradas multimodais com suporte a diferentes resoluções e proporções.
  • Tool Calling e System Prompt: Suporte nativo a chamadas de função e ao papel system, permitindo maior controle e integração com ferramentas externas.

Benchmark de Performance

O Neve Echo S demonstra desempenho alinhado a modelos de ponta em múltiplas categorias:

Categoria Benchmark Gemma 4 31B Gemma 4 26B A4B Neve Echo S
Knowledge MMLU Pro 85.2% 82.6% 69.4%
Reasoning GPQA Diamond 84.3% 82.3% 58.6%
Math AIME 2026 89.2% 88.3% 42.5%
General BigBench Extra Hard 74.4% 64.8% 33.1%

Detalhes da Arquitetura

  • Arquitetura: Mixture of Experts (MoE) com atenção híbrida (local + global intercalado).
  • Parâmetros: ~5B totais (com subset ativo por token para eficiência).
  • Janela de Contexto: Até 256K tokens.
  • Camadas: Arquitetura profunda com atenção global na camada final.
  • MoE: Roteamento dinâmico de experts (subset ativo por inferência), otimizando performance e uso de memória.

Como utilizar (GGUF)

Este modelo é compatível com llama.cpp, Ollama, LM Studio e outras ferramentas que suportam o formato GGUF. Foco direcionado ao uso do modelo na plataforma autoral da organização NeveAI

Licença

Este repositório e os pesos do modelo estão licenciados sob a Licença Apache 2.0.

Contato

Se tiver qualquer dúvida, por favor, levante um issue ou entre em contato conosco em NeveIA.

Downloads last month
314
GGUF
Model size
7B params
Architecture
gemma4
Hardware compatibility
Log In to add your hardware

4-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for NeveAI/Neve-Echo-S3-4B-QAT-GGUF

Quantized
(31)
this model

Collection including NeveAI/Neve-Echo-S3-4B-QAT-GGUF