Neo 1.0:3b

Neo ist ein feingetuntes Qwen2.5-3B-Instruct (QLoRA) für den Homelab-/DevOps-Einsatz mit Schwerpunkt Deutsch — trainiert auf einer NVIDIA P2000 (5 GB, Pascal).

Der Name steht für „Neue Version" (νέος) — ein Modell, das gezielt für reale Server-Administration, Docker, Linux, Netzwerktechnik, Python/C++ und deutsche Grammatik optimiert wurde.

📊 Training

Eigenschaft Wert
Basismodell Qwen/Qwen2.5-3B-Instruct (fp16)
Methode QLoRA (r=16, α=32, dropout 0.05)
Quantisierung NF4 (4-bit, bitsandbytes 0.43.3)
Epochen 3
Sequenzlänge 512
Samples 1.644 (84 → 20× erweitert)
Hardware NVIDIA P2000 5 GB, ~6,5 h
Framework Axolotl 0.4.0, torch 2.2.2, transformers 4.37.0

Trainingsdaten (Runde 1)

  • Benchmark-SFT: 84 Fragen aus eigenem LLM-Benchmark (MC + offene Fragen, Halluzinations-Kategorien)
  • Code: the-stack-smol (Python, C, C++, Dockerfile), code_search_net (Python)
  • Linux/Docker/Doku: tldr-pages, docker-docs, RFCs (DHCP, TCP, HTTP/1.1, TLS 1.3)
  • Foren: german.stackexchange, StackOverflow (Deutsch/Technik)
  • Deutsch: Second-Brain-Wiki, deutsche Grammatik
  • GitHub-Issues: docker/cli, docker/compose, moby/moby, ollama

🥊 Benchmark-Ergebnisse (eigener Test, 84 Fragen)

Modell Punkte
Qwen2.5-3B (Basis) 92/168 (55%)
Neo 1.0:3b 104/168 (62%)

Generalisierungs-Test (50 unbekannte Fragen — nicht im Training):

Modell Punkte
Qwen2.5-3B (Basis) 57/104 (55%)
Neo 1.0:3b 74/104 (71%)

Besonders stark: Linux (+33 pp), C++ (+29 pp), Netzwerktechnik (+20 pp), zahlen-falle (+57 pp).

🚀 Nutzung

Über Ollama (empfohlen)

# Modell direkt von HuggingFace laden
ollama run hf.co/<dein-username>/neo1.0-3b

# Oder: GGUF herunterladen und lokal registrieren
ollama create neo1.0:3b -f Modelfile

Direkt mit llama.cpp / GGUF

# GGUF-Dateien herunterladen
wget https://huggingface.co/<dein-username>/neo1.0-3b/resolve/main/neo-1.0-3b-Q4_K_M.gguf

# Mit llama.cpp ausführen
./llama-cli -m neo-1.0-3b-Q4_K_M.gguf -p "Deine Frage..."

Chat-Template

Qwen2.5-ChatML:

<|im_start|>system
Du beantwortest technische Fragen korrekt und ohne zu erfinden.<|im_end|>
<|im_start|>user
{Frage}<|im_end|>
<|im_start|>assistant

💬 Feedback & Verbesserungen

Dein Feedback ist willkommen! Nutze die Discussions um:

  • Fehler / Halluzinationen zu melden (mit Beispiel!)
  • Themenwünsche für die nächste Version zu nennen
  • Verbesserungen vorzuschlagen

Jeder Vorschlag fließt in die Daten für Neo 1.2:3b ein.

📁 Dateien

Datei Größe Zweck
neo-1.0-3b-Q4_K_M.gguf ~1,9 GB Empfohlene Quantisierung für Ollama/llama.cpp
neo-1.0-3b-f16.gguf ~6,2 GB Volle Genauigkeit (falls benötigt)

⚠️ Hinweise

  • Kleines Modell (3B): erwartet eine solide Basis für Homelab-/DevOps-Fragen, keine universelle Intelligenz
  • Trainiert auf begrenzten Daten (1.644 Samples) — Grammatik und Themen außerhalb des Korpus können schwächeln
  • Die Bewertung erfolgte über einen eigenen, domänenspezifischen Benchmark (nicht MMLU etc.)
Downloads last month
-
GGUF
Model size
3B params
Architecture
qwen2
Hardware compatibility
Log In to add your hardware

4-bit

16-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Dimitrex93/neo1.0-3b

Base model

Qwen/Qwen2.5-3B
Quantized
(271)
this model