CHUD-Qwen3.6-27B

ORPO run with synthetic data from Grok 4.5.

Like most of my models - untested

Training Configuration

Parameter Value
Training Mode ORPO
Base Model nbeerbower/BigBubba-Qwen3.6-27B
Learning Rate 8e-06
Epochs 2
Batch Size 2
Gradient Accumulation 4
Effective Batch Size 8
Max Sequence Length 2048
Optimizer paged_adamw_8bit
LR Scheduler cosine
Warmup Ratio 0.1
Weight Decay 0.01
Max Grad Norm 1.0
Seed 42
Beta 0.1
Max Prompt Length 1536
LoRA Rank (r) 32
LoRA Alpha 64
LoRA Dropout 0.0
Target Modules up_proj, down_proj, gate_proj, k_proj, q_proj, v_proj, o_proj
GPU NVIDIA GB10

Datasets

Trained on 3 concatenated datasets:

  1. nbeerbower/weasel-dpo (split: train)
  2. nbeerbower/seX-ai-dpo (split: train)
  3. nbeerbower/grok-politically-incorrect-dpo (split: train)

Reproduce this training run

This model was trained with Merlina. Credentials are not included — Merlina will use your own HF_TOKEN and WANDB_API_KEY from .env or the form.

Paste this code into Merlina's Load Configuration → From Code to rebuild the exact training setup:

merlina-config-v1:H4sIAOf1bGoC_81WS4_bRgz-K4s5247t3Ww3e8u2hwLNHoI2QIGiGFASJU08r8zDjrvY_15ypLGdNEGAIIfqRHEoDh8fP-pJSIMJOkgg7p-EBYPiXvz867tflm8PaK9Xt8vtTw9iITqMbVA-KWfJ4I8Ayio7XLXO9mrIAfjgKo4QsLvqgzNXcPWIQSsLy8TGpDauQ70iXwmGKO7_-nshYjuioZuFmWxfpNnxcnIsqoncY4jl7s2iGp91YrvarDbieSEaiCjLRaS1DWJo3AHDiwc1POSmgc-ycjn5nOTX087kTrtAIaaQcSFYlkHcX29nGbQf6fT2Zn7vgvPkVdyvV2vONAyYOKCskXMW2Usf3HuuqDvYKg-QsMq7Knyowr4KbhKocLNHmZyMsMepmiWABHEn09GXhF6_-_31G_nmkb7VCIErK6lXdHaHy_XtQthsJHrXjhTclsuX2lFG9Q-W1yFAp9AmCW2bTdalyzIm9GROGRv4KDXaIY1kvr65mzQUo_HpdLB5eX1bAkZd44KcHONgbnZpGKld8KxukMG4XlGnNTT0VTTOpZEM56oOYEyxeLkQysCAMmB0Ok_g3Ky3tRkB7O6iV9zMrjSzBx2pm0Z18hREBONLk6ZO80hETDwV0eXQ4lmqaYx5GOjLHuhwIQLVUaruU9wdkJzoZVcSi14rcjjlze8pIJiS1xzQSSMvO7FZ00Pghq5TnCNQSUogjKjvCCrin0tQPyKohWip7sZKA96Xb57E1H7yOAtkM7qIPKazwGG9xzYhx3USn58X35HLENxu6R3loFrQ-rhUtnUhkMv_X340or0LBgqoJqlmmtwOLd0b6GO00GiqASF-V-6cAMlDIztM5O2zs-c6XjOPfZv3fmBW7MwSExPLYYw0jFHWJOdBwi5TD9pCO3PJiw6JSZiMhuPpWnm6K2FMcydo5okK4pF4x1RymRmjV1pLJMXxa3RC8UXkkG-2Ezsxp0lLEVKLmUwOEAyRctlgM-vgnidsYrn1ajttgZuGYTTHz4oD2K6pSfocRybjMZ9UtKWGaXnIBqkkKKkMDrp6PvZsTQmpfSnNpMWP3lEthyH3p9v4RX7IYCe4lD3y9kb-Jh95FewQfbGXvd_cnlE95r4nGJ14bPJ_QDWMiXDUwrGWVgfJW5Y3SqiAbF2kpS0udgBZtDvvlE0XoNSuTGitFjlz9I9gGMnVkydMdJJ-McxB3nERmcjASKb5DYfw6kKxLYpXVUVOlS6kTuvqriiJDJILxPi8jfZYbj4lfT6PxAa0UiHQSCQaq_9azI0nyKQvnJYCzbtyuV59cnerlacRpKUzOt3NOIKUrFS8QgxVC-YfpXnTld8INVzEQX6IaloCs9LnuSjIKysWwjkq2rxJycHny4Epnp__BRCCRwLACQAA
Prefer JSON? The same config, expanded

Save this to data/configs/<name>.json, or import it via the Load Configuration dialog.

{
  "_metadata": {
    "name": "CHUD-Qwen3.6-27B",
    "description": "Training configuration shared from a Merlina-trained model.",
    "tags": [],
    "schema": "merlina/training-config",
    "schema_version": 1,
    "merlina_version": "2.1.1"
  },
  "base_model": "nbeerbower/BigBubba-Qwen3.6-27B",
  "output_name": "CHUD-Qwen3.6-27B",
  "use_lora": true,
  "lora_r": 32,
  "lora_alpha": 64,
  "lora_dropout": 0.0,
  "target_modules": [
    "up_proj",
    "down_proj",
    "gate_proj",
    "k_proj",
    "q_proj",
    "v_proj",
    "o_proj"
  ],
  "modules_to_save": [],
  "lora_task_type": "CAUSAL_LM",
  "learning_rate": 8e-06,
  "num_epochs": 2,
  "batch_size": 2,
  "gradient_accumulation_steps": 4,
  "max_length": 2048,
  "max_prompt_length": 1536,
  "model_type": "auto",
  "training_mode": "orpo",
  "beta": 0.1,
  "label_smoothing": 0.0,
  "gamma": 0.5,
  "image_resolution": 1024,
  "lora_rank": 32,
  "lora_use_dora": false,
  "mid_training_samples": true,
  "dataset": {
    "source": {
      "source_type": "huggingface",
      "repo_id": "nbeerbower/weasel-dpo",
      "split": "train",
      "streaming": false,
      "streaming_batch_size": 10000
    },
    "additional_sources": [
      {
        "source_type": "huggingface",
        "repo_id": "nbeerbower/seX-ai-dpo",
        "split": "train",
        "streaming": false,
        "streaming_batch_size": 10000,
        "column_mapping": {
          "prompt": "prompt",
          "chosen": "chosen",
          "rejected": "rejected"
        }
      },
      {
        "source_type": "huggingface",
        "repo_id": "nbeerbower/grok-politically-incorrect-dpo",
        "split": "train",
        "streaming": false,
        "streaming_batch_size": 10000,
        "column_mapping": {
          "prompt": "prompt",
          "chosen": "chosen",
          "rejected": "rejected"
        }
      }
    ],
    "format": {
      "format_type": "tokenizer",
      "enable_thinking": true,
      "auto_detect_thinking": true
    },
    "model_name": "nbeerbower/BigBubba-Qwen3.6-27B",
    "column_mapping": {
      "prompt": "prompt",
      "chosen": "chosen",
      "rejected": "rejected"
    },
    "convert_messages_format": true,
    "deduplicate": false,
    "dedupe_strategy": "prompt_chosen",
    "test_size": 0.01,
    "system_prompt_mode": "fill_empty",
    "training_mode": "orpo"
  },
  "seed": 42,
  "max_grad_norm": 1.0,
  "warmup_ratio": 0.1,
  "eval_steps": 0.2,
  "use_4bit": false,
  "use_wandb": true,
  "push_to_hub": true,
  "merge_lora_before_upload": true,
  "hf_hub_private": true,
  "export_gguf": false,
  "gguf_quant_types": [
    "Q4_K_M"
  ],
  "keep_gguf_fp16": false,
  "shuffle_dataset": true,
  "weight_decay": 0.01,
  "lr_scheduler_type": "cosine",
  "gradient_checkpointing": true,
  "logging_steps": 1,
  "optimizer_type": "paged_adamw_8bit",
  "adam_beta1": 0.9,
  "adam_beta2": 0.999,
  "adam_epsilon": 1e-08,
  "adafactor_relative_step": false,
  "adafactor_scale_parameter": false,
  "adafactor_warmup_init": false,
  "adafactor_decay_rate": -0.8,
  "adafactor_clip_threshold": 1.0,
  "attn_implementation": "auto",
  "use_liger": false,
  "torch_compile": false,
  "eval_on_start": false,
  "multi_gpu_strategy": "auto"
}

Trained with Merlina

Merlina on GitHub

Downloads last month
12
Safetensors
Model size
27B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for nbeerbower/CHUD-Qwen3.6-27B

Finetuned
(2)
this model
Quantizations
2 models

Datasets used to train nbeerbower/CHUD-Qwen3.6-27B