Built with Axolotl

See axolotl config

axolotl version: 0.17.0.dev0

base_model: bigscience/bloom-7b1
model_type: AutoModelForCausalLM
tokenizer_type: AutoTokenizer
trust_remote_code: true

load_in_8bit: false
load_in_4bit: false


datasets:
  - path: philipperen55/datasetSFT74bloom 
    ds_type: json
    data_files: datasetSFT74bloom.jsonl
    type: input_output
  

train_on_inputs: false
add_eos_token: false

  
dataset_prepared_path: /workspace/prepared_data
val_set_size: 0.05
output_dir: /workspace/output


sequence_len: 2048
sample_packing: false
pad_to_sequence_len: false
group_by_length: true





adapter: lora
lora_r: 32
lora_alpha: 64
lora_dropout: 0.1
lora_target_modules:
  - query_key_value
  - dense
  - dense_h_to_4h
  - dense_4h_to_h


gradient_accumulation_steps: 4
micro_batch_size: 4 
num_epochs: 3
learning_rate: 5e-5
lr_scheduler: cosine
warmup_ratio: 0.05
optimizer: adamw_torch_fused
weight_decay: 0.01
max_grad_norm: 1.0


bf16: true
fp16: false
tf32: true



overrides_of_model_config:
  use_cache: false
  

gradient_checkpointing: false


seed: 42
#mettre 24 si ya plus de 24 vspu, sinon mettre 16 si ya 24vcpu
dataset_num_proc: 16


logging_steps: 5
save_steps: 50
eval_strategy: steps 
eval_steps: 50
save_total_limit: 1


wandb_project: datasetSFT73


hub_model_id: philipperen55/bloom-7b1-datasetSFT73_lora4
push_to_hub: true
hub_strategy: every_save

bloom-7b1-datasetSFT73_lora4

This model is a fine-tuned version of bigscience/bloom-7b1 on the philipperen55/datasetSFT74bloom dataset. It achieves the following results on the evaluation set:

  • Loss: 2.2421
  • Ppl: 9.4130
  • Memory/max Active (gib): 103.37
  • Memory/max Allocated (gib): 103.37
  • Memory/device Reserved (gib): 162.69

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 5e-05
  • train_batch_size: 4
  • eval_batch_size: 4
  • seed: 42
  • gradient_accumulation_steps: 4
  • total_train_batch_size: 16
  • optimizer: Use OptimizerNames.ADAMW_TORCH_FUSED with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
  • lr_scheduler_type: cosine
  • lr_scheduler_warmup_steps: 14
  • training_steps: 288

Training results

Training Loss Epoch Step Validation Loss Ppl Active (gib) Allocated (gib) Reserved (gib)
No log 0 0 2.5977 13.4329 28.21 28.21 40.22
2.2493 0.5208 50 2.3535 10.5224 28.69 28.69 144.01
2.2127 1.0417 100 2.2872 9.8469 28.69 28.69 146.06
2.2381 1.5625 150 2.2652 9.6331 28.69 28.69 155.28
2.2350 2.0833 200 2.2565 9.5492 28.69 28.69 145.67
2.2595 2.6042 250 2.2430 9.4211 28.69 28.69 148.38
1.9304 3.0 288 2.2421 9.4130 103.37 103.37 162.69

Framework versions

  • PEFT 0.19.1
  • Transformers 5.9.0
  • Pytorch 2.10.0+cu128
  • Datasets 4.8.5
  • Tokenizers 0.22.2
Downloads last month
42
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for philipperen55/bloom-7b1-datasetSFT73_lora4

Adapter
(39)
this model