Add formal evaluation results for benchmark leaderboards

#1
by NitrAI - opened
NitrAI org

Moderato-V1-Pro Benchmark Evaluations

This PR registers verified benchmark evaluation results for Moderato-V1-Pro across 7 standard leaderboards:

  • llamaindex/ExtractBench (Mean): 88.65%
  • Idavidrein/gpqa (Diamond): 90.0%
  • ScaleAI/SWE-bench_Pro: 63.3%
  • datacurve/deep-swe: 53.2%
  • harborframework/terminal-bench-2.1: 79.5%
  • internlm/WildClawBench (Overall): 52.2%
  • cais/hle: 38.4%
NitrAI changed pull request status to open
NitrAI changed pull request status to closed

Sign up or log in to comment