Projekt Redeschrift KI
Hocheffizente deutsche KI-Transkriptionsmodelle für jedes Gerät (bald auch mit Dialekt-Unterstützung)
Aktuelle Fähigkeiten (V1.0; Stand 12.09.2026):
- Wortfehlerrate (WER) Hochdeutsch: 3,27 % (Variante S), 3,19 % (Variante M) und 3,12 % (Variante L, nahezu verlustfrei); unkomprimierte Referenz (Variante
REF): 3,02 %- In Verbindung mit der Redeschrift App: nochmals verbessert durch Einsatz von
VAD-Modellen, automatischem Volume-Boosting, und Pattern-basierten Nachkorrekturen (ab V2 auch mit Rechtschreibkorrektur-Modell)
- In Verbindung mit der Redeschrift App: nochmals verbessert durch Einsatz von
- 100% privat und läuft lokal? Ja! - keine Cloud, keine Internetverbindung
- Barrierefreiheit: Ja! - in Verbindung mit der Redeschrift App integriert sich die KI tief ins System und erlaubt die automatische Eingabe in das aktuell fokussierte Textfeld (z.B. Word, Browser, Chat, E-Mail, ...) sowie in die Zwischenablage (Copy & Paste)
- Braucht eine Grafikkarte? Nein! - läuft effizient auf modernen Standard-Prozessoren (CPU)
- Klein: Ja!, nur 672 MB (Variante S) !!
- Schnell: Ja! auf modernen Computern — 1 Sekunde Audio wird in ~40 Millisekunden transkribiert (Variante L; bis zu 26× schneller als Echtzeit)
- Unterstützte Sprachen: Deutsch, Deutsch mit Dialekt (ab V2), Englisch, Französisch, Spanisch, Italienisch, Niederländisch, Portugiesisch, Russisch, Polnisch
- Transkription mehrerer Sprachen in einer Aufnahme (Code-Switching): Ja, Anglizismen werden nahtlos unterstützt
- Live-Transkription ("Streamingfähig"): Ja
- Langzeit-Transkription: Ja, auch Aufnahmen mehrerer Stunden Länge sind kein Problem
- Plattform-unabhängig: Ja! (Windows, Linux, MacOS, Webbrowser, ...) - KI-Inferenz via ONNX Runtime, App und OS-Integration via Rust
Wie verwende ich dieses Modell?
Aktuell befindet sich dieses Modell sowie die Software rund um das Modell in der Entwicklung. Eine erste Version der Redeschrift App ist in einer Entwickler-Version aber bereits verfügbar. Diese wird aktuell primär auf macOS 15, Apple Silicon (Macbook Air 13", M4) getestet.
Weitere Informationen dazu gibt es auf der Projektseite / GitHub.
Modellvarianten
| Variante (Quantisierung) | Modellgröße | RAM beim Transkribieren | Geschwindigkeit (Macbook Air M4) | Wortfehlerquote (WER) |
|---|---|---|---|---|
S — uint8 (balanced-u4) |
672 MB | ~1,67 GB | ~22× Echtzeit · 2:45 min für 1 Stunde Audio | 3,27 % (borderline) |
M — uint8 (balanced-u4b32) |
726 MB | ~1,69 GB | ~12× Echtzeit · 5:00 min für 1 Stunde Audio | 3,19 % (empfohlen) |
L — int16 (balanced-fp16) |
1,25 GB | ~3,42 GB | ~26× Echtzeit · 2:19 min für 1 Stunde Audio | 3,12 % (≈ Referenz: 3,02 %) |
Anmerkung: Die Messung der Geschwindigkeit erfolgte auf einem Macbook Air M4; diese kann von Computer zu Computer variieren.
Welche Variante passt für meinen Computer?
- S — minimale Leistungsanforderungen für schwächere Hardware.
- M — typischerweise empfohlen. Beste Wortfehlerquote, aber etwas langsamer als S.
- L — wenn maximale Genauigkeit wichtiger ist als minimaler Speicher. Oft auch am schnellsten.
Häufige Fragen
Ist die Genauigkeit wirklich ausreichend? Ja. Selbst die kleinste Variante (S) liegt bei 3,27 % Wortfehlerquote — das entspricht etwa 1 Fehler pro 30 gesprochenen Wörtern. Die unkomprimierte Referenz erreicht 3,02 %.
Brauche ich eine Grafikkarte? Nein. Alle vier Varianten laufen effizient auf einer modernen Standard-CPU.
Funktioniert das offline? Ja. 100 % lokal, keine Internetverbindung erforderlich.
Welche Sprachen werden unterstützt? Deutsch (auch mit Dialekt ab V2), Englisch, Französisch, Spanisch, Italienisch, Niederländisch, Portugiesisch, Russisch, Polnisch.
Wo finde ich weitere technische Details? Siehe ARCH.md — vollständige Engineering-Referenz mit allen Eval-Artefakten, Reproduktionskommandos und Gate-Definitionen.
Welche Sprachen werden unterstützt?
- Deutsch - beste Transkriptionsqualität (auch mit Dialekt ab V2)
- Englisch
- Französisch
- Spanisch
- Italienisch
- Portugiesisch
- Niederländisch
- Dänisch
- Schwedisch
- Finnisch
- Estnisch
- Lettisch
- Litauisch
- Polnisch
- Tschechisch
- Slowakisch
- Slowenisch
- Kroatisch
- Bulgarisch
- Rumänisch
- Ungarisch
- Griechisch
- Maltesisch
- Russisch
- Ukrainisch
Einsatzzwecke / Mehrwerte
- Sprechen anstatt zu tippen: Tippen ist aufwändiger als sprechen. Wer viel mit KI arbeitet, wird die Vorteile der Spracherkennung schnell zu schätzen wissen. Allerdings möchte man nicht jedes Wort an eine Cloud senden, um es transkribieren zu lassen. Mit Redeschrift KI ist das nicht mehr nötig. Souveräne deutsche KI wird nun sinnvoll auf lokalen Geräten möglich.
- Hilfsmittel für Menschen mit Einschränkungen: Redeschrift KI kann Menschen mit körperlichen oder geistigen Einschränkungen, z.B. Menschen mit Dyslexie, kostenlos und diskret helfen, sich gewählt und korrekt auszudrücken. Menschen mit körperlichen Einschränkungen, die das Tippen erschweren, können Redeschrift KI nutzen. Ältere Menschen, denen das Tippen schwer fällt und junge Menschen, die das Tippen noch nicht gut beherrschen, können Redeschrift KI ebenfalls nutzen, um ihre Lebensqualität zu verbessern.
- Integrationskurse (Deutsch als Fremdsprache, DaF) und Lernende von Sprachen - z.B. Deutsch: Redeschrift KI kann Menschen, die Deutsch als Fremdsprache lernen, helfen, ihre Aussprache zu verbessern und ihre Sprachkenntnisse zu erweitern. So kann Redeschrift KI von Dozent:innen und Lernenden auch in Integrationskursen eingesetzt werden, um die Sprachkenntnisse der Teilnehmenden zu verbessern. Durch die niedrige Fehlerrate ist weitgehend sichergestellt: "Wenn Dich die Redeschrift-KI nicht versteht, versteht Dich auch Dein Gegenüber nicht." - So können Teilnehmende von Sprachkursen auch zu hause kostenlos in Ruhe üben und sind dabei keinem Gruppendruck ausgesetzt. Dasselbe gilt bald (ab V2) auch für Menschen, die Dialekte erlernen möchten. Wenn Redeschrift KI falsch transkribiert, ist das ein Hinweis darauf, dass die Aussprache noch nicht ganz korrekt ist.
- Transkription von Audioaufnahmen: Redeschrift KI kann auch Audioaufnahmen, Podcasts, Meetings usw. in hoher Qualität und sehr schnell transkribieren. Das ist besonders für Journalisten, Podcaster, Studierende und andere interessant, die Interviews, Vorträge oder andere Audioinhalte lokal transkribieren möchten.
Projektplan: Wie geht es weiter?
Vision: Das Ziel des Projekts Redeschrift KI ist ein hochwertiges, effizientes und privates Transkriptionsmodell für den gesamten deutschen Sprachraum, das auch Dialekte und regionale Varianten unterstützt und dabei eine sehr niedrige Wortfehlerrate (WER) erreicht, die bei unter 3% liegt; ein Transkriptionsmodell, das auf jeder Plattform in Echtzeit zuverlässig funktioniert und kostenlos sowie privat und kommerziell von jeder Person und Organisation eingesetzt werden kann.
WIP: Die Redeschrift App wird in den kommenden Wochen und Monaten stark weiterentwickelt.
- Aktuell werden Dialekt-Datensätze gesammelt, kuratiert und auch synthetische Datensätze per TTS generiert. Dieser Ansatz ist in Teilen neu - die ersten Ergebnisse bereits vielversprechend. Auch das Fine-Tuning des KI-Modells auf weitere Hochdeutsch und Dialekt-Datensätze wird in den kommenden Wochen und Monaten fortgesetzt. Dieses Modell wird laufend Updates erfahren. Der Fine-Tuning-Code wird ebenfalls veröffentlicht werden. Künftig wird ebenfalls mit einem MiCA-basierten Ansatz experimentiert, um die Trainingsleistung zu verbessern.
- Um die Fehlerrate auch nach der KI-Modellinferenz noch weiter zu verringern, wird ein neues, spezifisches NLP-Modell spezifisch auf Basis der Ausgaben des Redeschrift KI-Modells trainiert. Dieses Modell kommt in der Redeschrift App zum Einsatz und korrigiert die Transkriptionen des KI-Modells praktisch als automatische Rechtschreibkorrektur. Dieser Ansatz ist ebenfalls neu und verbessert die Fehlerrate (WER) aktuell bereits um ~12% (3,3% vs. 3,6%).
- Da die Fehlermetrik WER nicht alle Aspekte der Transkriptionsqualität abbildet, wird zudem an einer neuen, auf Semantik zielenden Metrik gearbeitet und das Modell künftig auch mit dieser zweiten Metrik evaluiert.
- Außerdem wird die App um eine Vielzahl von Funktionen erweitert, die u.A. eine durchgehende Live-Transkription, automatische Eingabe in das aktuell fokussierte Textfeld, Rechtschreibkorrektur, Übersetzung, und automatische Spracherkennung ermöglichen. Auch die Integration in bestehende Softwarelösungen wird mittels Programmierschnittstelle (API) möglich sein. Veröffentlichungen und Tests unter Linux und Windows sind geplant. Die KI-Modelle werden kontinuierlich verbessert, sodass die Wortfehlerrate (WER) noch weiter sinken wird.
Lizenz
CC BY 4.0 (Creative Commons Attribution 4.0 International) - https://creativecommons.org/licenses/by/4.0/
Du darfst dieses KI-Modell sehr weitgehend nutzen:
- kopieren und weiterverbreiten
- verändern / bearbeiten / kombinieren
- kommerziell nutzen
- auch als Bestandteil eines Datasets oder zum Training von Modellen, sofern keine anderen Rechte entgegenstehen.
Die zentrale Pflicht ist Namensnennung (Attribution). Du musst dabei folgendes in angemessener Form angeben:
- Urheber/Quelle, Hinweis auf CC BY 4.0, Lizenzreferenz/Link und kennzeichnen, falls du Änderungen vorgenommen hast.
Danksagung / Attribution
Dieses Projekt wäre nicht möglich gewesen ohne die großartige Vorarbeit der folgenden Personen und Organisationen:
- Florian Zimmermeister, flozi00 - Training des deutschen Basismodells (
primeline/parakeet-primeline)[https://huggingface.co/primeline/parakeet-primeline] - primeLine Solutions GmbH - Bereitstellung von KI-Hardware zum Training des Basismodell-Checkpoints parakeet-primeline
- Mozilla Common Voice - Open Source Sprachdaten (Common Voice)
- TU Darmstadt - Open Source Sprachdaten (Tuda-De)
- OpenSLR - Open Source Sprachdaten (Multilingual Librispeech)
- NVIDIA - Open Weight KI-Modell (
nvidia/parakeet-tdt-0.6b-v3)[https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3] - Hugging Face - KI-Infrastruktur (Transformers, Datasets, Accelerate, ...)
- OpenAI - Open Source KI-Modelle (Whisper - Forschung & Inspiration)
Model tree for kyr0/redeschrift-1.0
Base model
primeline/parakeet-primeline