YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
FrontierLLMHarnessValidation
Kleines Validierungs-Repo fuer eine einzige Frage:
"Wie veraendert sich derselbe Harness, wenn OpenClaude von Opus 4.7 auf GPT-5.4 umgestellt wird?"
Scope
Nur Validierung. Kein Produkt. Kein Dashboard zuerst. Keine Meta-Architektur.
Was hier als Naechstes zu tun ist
Einen kleinen festen Testkatalog definieren
- 3 bis 5 Prompts
- gleiche Prompts fuer beide Modelle
- gleiche Harness-Bedingungen
Eine minimale Run-Struktur festlegen
- Modellname
- Prompt
- Antwort
- Tool-Calls
- Laufzeit
- Exit/Done-Zustand
- kurze Judge-Notiz
Fuer jeden Testfall zwei Runs sammeln
- einmal OpenClaude mit Opus 4.7
- einmal OpenClaude mit GPT-5.4
Die Ergebnisse als einfache JSON-Dateien abspeichern
- noch keine Datenbank
- noch keine komplexe Pipeline
Erst danach eine Auswertung bauen
- Unterschiede markieren
- keine Annahmen mehr, sondern echte Laeufe vergleichen
Nicht jetzt
- kein grosses Benchmark-System
- keine automatische Judge-Infrastruktur
- keine neue Multi-Agent-Architektur
- keine Website zuerst
Ziel
Von "plausibel erzaehlter Unterschied" zu "mit echten Runs belegter Unterschied".
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support