DeutschGPT

DeutschGPT ist ein auf Deutsch spezialisiertes Sprachmodell von KordAI, das auf Qwen3 1.7B Base basiert und für deutschsprachige Konversationen und Instruktionen feinabgestimmt wurde.

Das Modell wurde mit Unsloth und der Hugging Face TRL-Bibliothek trainiert.

Modellbeschreibung

DeutschGPT wurde entwickelt, um ein kompaktes und effizientes Modell für deutschsprachige Aufgaben und Konversationen bereitzustellen.

Das Modell eignet sich insbesondere für:

  • 🇩🇪 deutschsprachige Konversation
  • Beantwortung von Fragen
  • Befolgen von Anweisungen
  • Textgenerierung
  • einfache Zusammenfassungen
  • Umformulierungen und allgemeine Schreibaufgaben

Entwickelt von: KordAI Basismodell: unsloth/qwen3-1.7b-base-unsloth-bnb-4bit Sprache: Deutsch Parameter: 1,7 Milliarden Lizenz: Apache 2.0

Trainingsformat

Das Modell wurde auf deutschsprachigen Konversationsdaten feinabgestimmt.

Die Konversationen verwenden ein einfaches, rollenbasiertes Format:

# SYSTEM:
Sie sind ein hilfreicher Assistent.
# USER:
Wer ist Sebastian Vettel?
# ASSISTANT:
Sebastian Vettel ist ein deutscher Automobilrennfahrer ...

Die Rollen werden dabei durch die folgenden Abschnitte dargestellt:

  • # SYSTEM: – Systemanweisung
  • # USER: – Eingabe des Benutzers
  • # ASSISTANT: – Antwort des Modells

Beispiel

# SYSTEM:
Sie sind ein hilfreicher Assistent.
# USER:
Was ist die Hauptstadt von Deutschland?
# ASSISTANT:
Die Hauptstadt von Deutschland ist Berlin.

Bei der Verwendung des Modells sollte dieses Format beibehalten werden, damit die Eingabe dem Format entspricht, auf dem das Modell trainiert wurde.

Verwendung

from transformers import AutoTokenizer, AutoModelForCausalLM

model_id = "KordAI/DeutschGPT"

tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto"
)

prompt = """# SYSTEM:
Sie sind ein hilfreicher Assistent.
# USER:
Setzen Sie die Fibonacci-Folge fort: 1, 1, 2, 3, 5, 8,
# ASSISTANT:
"""

inputs = tokenizer(
    prompt,
    return_tensors="pt"
).to(model.device)

outputs = model.generate(
    **inputs,
    max_new_tokens=64
)

print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Training

DeutschGPT wurde mit Unsloth und der Hugging Face TRL-Bibliothek feinabgestimmt.

Unsloth wurde verwendet, um das Training effizienter durchzuführen und eine höhere Trainingsgeschwindigkeit zu ermöglichen.

Unsloth

Beispiel

Eingabe:

# SYSTEM:
Sie sind ein hilfreicher Assistent.
# USER:
Wer ist Sebastian Vettel?
# ASSISTANT:

Ausgabe:

Sebastian Vettel ist ein deutscher Automobilrennfahrer, der in der Formel-1-Weltmeisterschaft erfolgreich war. Er gewann vier Weltmeistertitel in Folge und gehört zu den erfolgreichsten deutschen Fahrern in der Geschichte der Formel 1.

Einschränkungen

DeutschGPT ist mit 1,7 Milliarden Parametern ein vergleichsweise kleines Sprachmodell. Die Qualität kann daher bei komplexen Aufgaben, umfangreichen Kontexten, anspruchsvollem logischem Schlussfolgern oder sehr spezifischem Fachwissen eingeschränkt sein.

Wie bei anderen generativen Sprachmodellen können Antworten:

  • sachlich falsch sein,
  • unvollständig sein,
  • veraltete oder erfundene Informationen enthalten,
  • bei komplexen Aufgaben Fehler aufweisen.

Generierte Inhalte sollten daher bei wichtigen Anwendungen überprüft werden.

Lizenz

DeutschGPT wird unter der Apache License 2.0 veröffentlicht.

Bitte beachte zusätzlich die Lizenzbedingungen des zugrunde liegenden Qwen3-Modells sowie die Lizenzen der für das Fine-Tuning verwendeten Datensätze.

Credits

DeutschGPT wurde von KordAI entwickelt.

Das Modell wurde mit Unsloth und Hugging Face TRL trainiert.

Mit Unsloth erstellt

Downloads last month
167
Safetensors
Model size
2B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support