TTS-Systeme — Analyse-Korpus

One-line pitch. 11 Code-basierte Analyse-Reports zu Text-to-Speech-Systemen im HAI-Stack, plus ein 45-MB-Sample-Podcast.

Korpus von smlflg zur Kartografie der TTS-Landschaft, die in seinen Agent-Profilen real im Einsatz ist. Hauptbefund: Edge TTS ist das Rückgrat — 9 von 11 Systemen hängen daran (direkt, per CLI oder über den lokalen Server auf Port 5050). Kokoro ist der lokale Fallback, ElevenLabs ein Upstream-Beispiel.

This Hugging Face mirror is maintained by smlflg.

Inhalt

# Report System Engine
01 Sidecar florian Sidecars Sprachkanal (V1–V7) Edge TTS (:5050, Florian)
02 HAI speak.py Event-driven Voice-Layer + Multivoice-Reader Edge TTS + mpv
03 multikanal piper.py Synthese im MultiKanal-Daemon Edge TTS / Piper / spd-say
04 VoiceMode Edge-TTS OpenAI-kompatibler FastAPI-Wrapper, systemd Edge TTS
05 VoiceMode Kokoro Upstream-Stack (remsky/kokoro-fastapi) Kokoro-82M (lokal)
06 Agent8 Multivoice-Podcast LangGraph-Lernpodcast, 6 Rollen, 48 Segmente Edge TTS + ffmpeg
07 META2.0 Podcast-Audio Markdown-Dialog → MP3, 5 Stimmen, 137 Segmente edge-tts + ffmpeg
08 MyAIGame tts_client GTK-GUI-Client zum Edge-TTS-Server Edge TTS (HTTP)
09 MyAIGame TUI tts.py Fire-and-forget zum MultiKanal-Daemon indirekt
10 NightGoal speech.py STT/TTS-CLI-Brücke edge-tts + faster-whisper
11 ElevenLabs talk-llama whisper.cpp-Upstream-Beispiel ElevenLabs API

Plus: TTS-Systeme-Podcast.m4a (45 MB Sample-Audio).

Quer-Erkenntnisse

  • Ein Server, viele Clients — der VoiceMode Edge-TTS-Server (04) ist der Hub für Sidecar-Florian, tts_client und die TUI.
  • Chunking ist die wiederkehrende Erfindung — das 140-Zeichen-Limit gegen Edge-TTS-Truncation wurde mindestens dreimal unabhängig gebaut. Kandidat für eine gemeinsame Preprocessing-Lib.
  • Podcast-Compiler existieren doppelt — Agent8 (hardcodiert) und META2.0 (Markdown-parsend) teilen dieselbe Pipeline: Segmente → edge-tts → ffmpeg concat → Verify.
  • Reifegrad: 7× solide, 3× Prototyp, 1× Demo. Solide-Cluster: Single-User-produktionsnah, Multi-User-fern.

Owner

Maintained by smlflg — CS student, KI²NG program (TH Mannheim); Werkstudent Berlin; Builder der HAI-Stack (HAI-Agent-Workflow, HAI-DPPM, Hermes-Agent).

License

MIT — see LICENSE.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support