gemma-3-12b-it-antislop-de
Load this model with
transformers==4.56.2. transformers 5.x renames the Gemma 3 parameters, so the checkpoint no longer matches. transformers reports nothing but a warning ("some params were newly initialized because missing from the checkpoint"), loads randomly initialised weights and the model then emits pure gibberish, unrelated tokens from random languages and writing systems. If you see that, you are looking at a loading problem, not at a broken model. The working stack and the reason for the pin are in Inferenz.
Always run this model with the anti-slop system prompt. Combined with it, the fine-tune is the strongest phrase suppressor of every variant tested, 6.27 banlist hits per 1,000 tokens against 21.04 for the same prompt on the untouched base model. Without the prompt it falls back on its own trained-in crutches and writes "maximal" 59 times and "eben alles" 13 times across 36 texts.
It pays for the low hit rate with worse sentence structure and occasional broken grammar, and two blind LLM reviewers never picked it as the best text of a task. Use it for aggressive phrase suppression with a human editing pass afterwards, not for unsupervised final copy. Both halves of that result are documented below.
Full write-up, code, evaluation scripts and the project diary: github.com/PhilflowIO/antislop-de
Ein FTPO-Finetune von google/gemma-3-12b-it für deutsche Website- und
Marketing-Copy. Trainiert mit Final Token Preference Optimization aus Sam
Paechs auto-antislop, auf
Deutsch portiert (deutsches Human-n-gram-Profil, deutsche Banlist, wordfreq de).
Built with Gemma. Es gelten die Gemma Terms of Use und die Prohibited Use Policy.
Was es kann
Mit dem System-Prompt zusammen ist es die stärkste Phrasenunterdrückung aller gemessenen Varianten. 6,27 Banlist-Treffer je 1.000 Tokens, gegen 21,04 beim System-Prompt allein und 38,64 beim unveränderten Basismodell. Finetune und Prompt stapeln sich, sie ersetzen einander nicht.
Der Finetune entfernt dabei auch eine echte Floskel, „revolutionier…“ fällt von 13 auf 5 von 36 Texten. Zwei konkrete Defekte der ersten Trainingsversion sind behoben, eine erfundene Produktbehauptung fiel von 20 auf 0 von 36 Texten, sieben Textkollapse auf 0.
Alle Zahlen aus derselben Messung: 36 Holdout-Prompts, dieselbe H100,
temperature=0.7, Seed 1234+idx.
Gemessen mit torch==2.8.* und transformers==4.56.2.
| Arm | Banlist-Treffer /1k | Struktur-Slop (Median) | „maximal“ | „absolut“ | „eben alles“ | „revolutionier…“ |
|---|---|---|---|---|---|---|
| Basismodell, nackt | 38,64 | 56,1 | 1 | 5 | 0 | 13 |
| Basismodell + Prompt | 21,04 | 33,7 | 1 | 1 | 0 | 0 |
| dieses Modell, nackt | 12,04 | 63,8 | 59 | 55 | 13 | 5 |
| dieses Modell + Prompt | 6,27 | 60,6 | 15 | 17 | 0 | 0 |
Was es kostet
Der niedrige Trefferwert ist gegen dieselbe Liste gemessen, gegen die trainiert wurde. Er belegt, dass das Training sein Ziel getroffen hat, nicht dass der Text besser wird. Was der Prompt nicht repariert, ist der Satzbau. Der Struktur-Slop bleibt bei 60,6, gegen 33,7 beim Basismodell mit demselben Prompt. Nominalstil und Passiv-Überhang werden durch das Training schlechter, nicht besser.
Dazu kommen Grammatikschäden, die im Basismodell nicht vorkommen. Belegte Beispiele aus den Holdout-Texten sind „Deine Daten bleiben deiner“ und „Der Raven-Agent plant deinen Terminen“. Von zehn Wendungen, die die Gutachter als kaputt markiert haben, stammen acht ausschließlich aus den Finetune-Armen. Das ist die Herkunftsprüfung der benannten Fehler, keine systematische Grammatikprüfung.
Im blinden Lesetest über dieselben 36 Prompts, verdeckte Zuordnung, zwei LLM-Gutachter und keine menschlichen Rater, wurde dieses Modell nie so oft als bester Text gewählt wie das Basismodell mit Prompt.
| Arm | Gutachter 1: bester / schlechtester | Gutachter 2: bester / schlechtester |
|---|---|---|
| Basismodell, nackt | 7 / 1 | 2 / 1 |
| Basismodell + Prompt | 25 / 1 | 31 / 0 |
| dieses Modell, nackt | 0 / 20 | 0 / 34 |
| dieses Modell + Prompt | 4 / 14 | 3 / 1 |
Der Arm mit dem besten Messwert ist also nicht der Arm mit den besten Texten. Die Metrik verbessert sich, der Text verschlechtert sich, im selben Experiment.
Wofür man es nimmt
Für aggressive Phrasenunterdrückung mit anschließender menschlicher Redaktion. Wenn Floskeln aus einer festen Liste zuverlässig verschwinden müssen und danach jemand über den Text geht, ist dieses Modell mit Prompt die stärkste Variante.
Nicht für unbeaufsichtigten Endtext. Wer einen lesbaren Entwurf ohne Nachredaktion will, nimmt den System-Prompt allein auf dem Basismodell.
Weitere Limitierungen
- du/Sie-Konsistenz. Bekannter Defekt, nicht behoben.
- Capability-Erhalt ist nicht belegt. GSM8K 87 auf 86 Prozent und MMLU 68 auf 68 wurden mit je 100 Aufgaben gemessen. Ein Fall Unterschied liegt im Rauschen und beweist nichts, in keine Richtung.
Inferenz
Versionen
Das Modell wurde mit diesem Stack trainiert und gemessen, und nur damit lädt der Checkpoint korrekt.
pip install "torch==2.8.*" "transformers==4.56.2"
Mit transformers 5.x benennt die Bibliothek die Gemma-3-Parameter um. Der Checkpoint greift dann nicht mehr. transformers meldet nur eine Warnung, „some params were newly initialized because missing from the checkpoint", lädt zufällig initialisierte Gewichte und das Modell erzeugt reines Kauderwelsch, also zusammenhanglose Tokens aus zufälligen Sprachen und Schriftsystemen. Wer das sieht, hat kein kaputtes Modell vor sich, sondern eine falsche transformers-Version.
Am 2026-09-05 direkt gegeneinander reproduziert, derselbe Prompt und dasselbe
Modell. Mit der neuesten transformers-Version kam Kauderwelsch, mit
transformers==4.56.2 sauberes Deutsch.
Der Pin ist nötig, weil vLLM 0.11.0 transformers>=4.55.2 ohne Obergrenze
verlangt. Ohne die feste Version zieht pip transformers 5.x nach, und genau 5.x
löst die Umbenennung aus.
Aufruf
Default temperature=0.7. Die Trainings-Temperatur 1.0 ist für die Auslieferung
zu heiß.
from transformers import AutoModelForImageTextToText, AutoTokenizer
tok = AutoTokenizer.from_pretrained("PhilflowIO/gemma-3-12b-it-antislop-de")
model = AutoModelForImageTextToText.from_pretrained(
"PhilflowIO/gemma-3-12b-it-antislop-de", torch_dtype="bfloat16", device_map="cuda")
Der System-Prompt gehört in jeden Aufruf. Ohne ihn produziert das Modell seine antrainierten Tics.
Du bist ein erfahrener deutscher Werbetexter. Gib ausschließlich den fertigen
Website-Text aus, keine Vorrede, keine Erklärung, keine Optionen. Schreibe knapp
und direkt in der Du-Form. Vermeide Marketing-Floskeln und leere Verstärker wie
'maximal', 'kristallklar', 'nahtlos', 'inklusive allem', 'souverän'. Keine
Doppelpunkt-Einleitungen, keine Adjektiv-Aufzählungen. Aktiv statt Passiv, kurze
Sätze, konkret sagen, was das Produkt tut.
Volle Fassung samt Inferenz-Einstellungen:
configs/antislop_prompt.md
Gib die Produktfakten faktentreu in den User-Prompt. Ohne sie erfindet das Modell Positionierung.
Nicht enthalten
Nur Modellgewichte, Config und Tokenizer. Keine Trainings-Prompts, keine Geschäftsdaten.
Wo man ansetzen sollte
Wer die Methode weitertreiben will, findet die Ansatzpunkte im Repo unter „Was das für dich heißt“. Die im Upstream-Framework berechnete, aber nie angewendete Chosen-Quota, eine Messung gegen eine Liste, die das Training nicht kannte, der reine Prompt als ernstzunehmender Kontrollarm, und alle Kombinationen messen statt nur der naheliegenden Paare.
- Downloads last month
- 436