Instructions to use Codemaster67/Olmo with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Codemaster67/Olmo with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Codemaster67/Olmo-7b-spe") model = PeftModel.from_pretrained(base_model, "Codemaster67/Olmo") - Transformers
How to use Codemaster67/Olmo with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="Codemaster67/Olmo")# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Codemaster67/Olmo", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use Codemaster67/Olmo with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "Codemaster67/Olmo" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Codemaster67/Olmo", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/Codemaster67/Olmo
- SGLang
How to use Codemaster67/Olmo with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "Codemaster67/Olmo" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Codemaster67/Olmo", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Codemaster67/Olmo" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Codemaster67/Olmo", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use Codemaster67/Olmo with Docker Model Runner:
docker model run hf.co/Codemaster67/Olmo
| { | |
| "best_global_step": 1200, | |
| "best_metric": 1.0421009063720703, | |
| "best_model_checkpoint": "./olmo_chem_lora_cpt_QLoRA_r64_alpha128/checkpoint-1200", | |
| "epoch": 0.4819277108433735, | |
| "eval_steps": 50, | |
| "global_step": 1200, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.00040160642570281126, | |
| "grad_norm": 36.74913787841797, | |
| "learning_rate": 0.0, | |
| "loss": 2.976954936981201, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.004016064257028112, | |
| "grad_norm": 40.237674713134766, | |
| "learning_rate": 3.614457831325301e-07, | |
| "loss": 3.035895029703776, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.008032128514056224, | |
| "grad_norm": 17.999801635742188, | |
| "learning_rate": 7.630522088353415e-07, | |
| "loss": 2.75059814453125, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.012048192771084338, | |
| "grad_norm": 13.56201171875, | |
| "learning_rate": 1.1646586345381528e-06, | |
| "loss": 2.38979434967041, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.01606425702811245, | |
| "grad_norm": 10.360796928405762, | |
| "learning_rate": 1.566265060240964e-06, | |
| "loss": 2.0525840759277343, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.020080321285140562, | |
| "grad_norm": 16.763572692871094, | |
| "learning_rate": 1.967871485943775e-06, | |
| "loss": 1.8794815063476562, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.020080321285140562, | |
| "eval_loss": 1.8244566917419434, | |
| "eval_runtime": 224.0827, | |
| "eval_samples_per_second": 17.087, | |
| "eval_steps_per_second": 0.536, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.024096385542168676, | |
| "grad_norm": 10.257641792297363, | |
| "learning_rate": 2.3694779116465868e-06, | |
| "loss": 1.7737924575805664, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.028112449799196786, | |
| "grad_norm": 20.079599380493164, | |
| "learning_rate": 2.771084337349398e-06, | |
| "loss": 1.6911544799804688, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.0321285140562249, | |
| "grad_norm": 10.683834075927734, | |
| "learning_rate": 3.172690763052209e-06, | |
| "loss": 1.623727798461914, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.03614457831325301, | |
| "grad_norm": 11.064703941345215, | |
| "learning_rate": 3.5742971887550204e-06, | |
| "loss": 1.5919998168945313, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.040160642570281124, | |
| "grad_norm": 9.582036972045898, | |
| "learning_rate": 3.975903614457832e-06, | |
| "loss": 1.5387580871582032, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.040160642570281124, | |
| "eval_loss": 1.5256246328353882, | |
| "eval_runtime": 224.0546, | |
| "eval_samples_per_second": 17.09, | |
| "eval_steps_per_second": 0.536, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.04417670682730924, | |
| "grad_norm": 9.940044403076172, | |
| "learning_rate": 4.377510040160643e-06, | |
| "loss": 1.49784574508667, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.04819277108433735, | |
| "grad_norm": 11.362184524536133, | |
| "learning_rate": 4.779116465863454e-06, | |
| "loss": 1.5389199256896973, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.05220883534136546, | |
| "grad_norm": 9.787059783935547, | |
| "learning_rate": 5.180722891566266e-06, | |
| "loss": 1.4939092636108398, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.05622489959839357, | |
| "grad_norm": 9.76535701751709, | |
| "learning_rate": 5.582329317269076e-06, | |
| "loss": 1.4706912994384767, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.060240963855421686, | |
| "grad_norm": 9.557772636413574, | |
| "learning_rate": 5.983935742971888e-06, | |
| "loss": 1.4295058250427246, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.060240963855421686, | |
| "eval_loss": 1.4075552225112915, | |
| "eval_runtime": 224.3397, | |
| "eval_samples_per_second": 17.068, | |
| "eval_steps_per_second": 0.535, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.0642570281124498, | |
| "grad_norm": 8.256240844726562, | |
| "learning_rate": 6.385542168674699e-06, | |
| "loss": 1.3934820175170899, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.06827309236947791, | |
| "grad_norm": 10.668194770812988, | |
| "learning_rate": 6.78714859437751e-06, | |
| "loss": 1.3897838592529297, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.07228915662650602, | |
| "grad_norm": 8.989994049072266, | |
| "learning_rate": 7.188755020080321e-06, | |
| "loss": 1.3797410011291504, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.07630522088353414, | |
| "grad_norm": 7.747810363769531, | |
| "learning_rate": 7.590361445783133e-06, | |
| "loss": 1.3742728233337402, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.08032128514056225, | |
| "grad_norm": 7.7544074058532715, | |
| "learning_rate": 7.991967871485944e-06, | |
| "loss": 1.3565238952636718, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.08032128514056225, | |
| "eval_loss": 1.3342411518096924, | |
| "eval_runtime": 224.1047, | |
| "eval_samples_per_second": 17.086, | |
| "eval_steps_per_second": 0.535, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.08433734939759036, | |
| "grad_norm": 7.9385085105896, | |
| "learning_rate": 8.393574297188756e-06, | |
| "loss": 1.3680735588073731, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.08835341365461848, | |
| "grad_norm": 7.368689060211182, | |
| "learning_rate": 8.795180722891567e-06, | |
| "loss": 1.3239299774169921, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.09236947791164658, | |
| "grad_norm": 8.16849422454834, | |
| "learning_rate": 9.196787148594378e-06, | |
| "loss": 1.330996036529541, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.0963855421686747, | |
| "grad_norm": 9.847034454345703, | |
| "learning_rate": 9.598393574297188e-06, | |
| "loss": 1.3019088745117187, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.10040160642570281, | |
| "grad_norm": 6.754732131958008, | |
| "learning_rate": 1e-05, | |
| "loss": 1.283926010131836, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.10040160642570281, | |
| "eval_loss": 1.2852883338928223, | |
| "eval_runtime": 224.1824, | |
| "eval_samples_per_second": 17.08, | |
| "eval_steps_per_second": 0.535, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.10441767068273092, | |
| "grad_norm": 6.626065254211426, | |
| "learning_rate": 9.999508697551502e-06, | |
| "loss": 1.2729861259460449, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.10843373493975904, | |
| "grad_norm": 6.478898525238037, | |
| "learning_rate": 9.998034886757237e-06, | |
| "loss": 1.2489843368530273, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.11244979919678715, | |
| "grad_norm": 6.022712230682373, | |
| "learning_rate": 9.99557885725195e-06, | |
| "loss": 1.2988578796386718, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.11646586345381527, | |
| "grad_norm": 6.245314598083496, | |
| "learning_rate": 9.992141091696967e-06, | |
| "loss": 1.2607011795043945, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.12048192771084337, | |
| "grad_norm": 6.8380889892578125, | |
| "learning_rate": 9.987722265685338e-06, | |
| "loss": 1.2081457138061524, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.12048192771084337, | |
| "eval_loss": 1.2430709600448608, | |
| "eval_runtime": 224.0772, | |
| "eval_samples_per_second": 17.088, | |
| "eval_steps_per_second": 0.536, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.12449799196787148, | |
| "grad_norm": 5.553050518035889, | |
| "learning_rate": 9.98232324760908e-06, | |
| "loss": 1.2201088905334472, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.1285140562248996, | |
| "grad_norm": 5.528981685638428, | |
| "learning_rate": 9.975945098488514e-06, | |
| "loss": 1.2170144081115724, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.13253012048192772, | |
| "grad_norm": 6.345343589782715, | |
| "learning_rate": 9.96858907176375e-06, | |
| "loss": 1.2358662605285644, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.13654618473895583, | |
| "grad_norm": 5.249575138092041, | |
| "learning_rate": 9.960256613048367e-06, | |
| "loss": 1.2119761466979981, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.14056224899598393, | |
| "grad_norm": 4.9837646484375, | |
| "learning_rate": 9.950949359845309e-06, | |
| "loss": 1.2059650421142578, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.14056224899598393, | |
| "eval_loss": 1.2071032524108887, | |
| "eval_runtime": 224.1972, | |
| "eval_samples_per_second": 17.079, | |
| "eval_steps_per_second": 0.535, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.14457831325301204, | |
| "grad_norm": 5.1654791831970215, | |
| "learning_rate": 9.940669141225097e-06, | |
| "loss": 1.1992589950561523, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.14859437751004015, | |
| "grad_norm": 6.3491950035095215, | |
| "learning_rate": 9.929417977466356e-06, | |
| "loss": 1.1967281341552733, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.15261044176706828, | |
| "grad_norm": 6.096224308013916, | |
| "learning_rate": 9.91719807965881e-06, | |
| "loss": 1.184930419921875, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.1566265060240964, | |
| "grad_norm": 4.983779430389404, | |
| "learning_rate": 9.904011849268744e-06, | |
| "loss": 1.195562744140625, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.1606425702811245, | |
| "grad_norm": 5.229851722717285, | |
| "learning_rate": 9.889861877667071e-06, | |
| "loss": 1.1917385101318358, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.1606425702811245, | |
| "eval_loss": 1.1810219287872314, | |
| "eval_runtime": 224.2238, | |
| "eval_samples_per_second": 17.077, | |
| "eval_steps_per_second": 0.535, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.1646586345381526, | |
| "grad_norm": 4.667690277099609, | |
| "learning_rate": 9.874750945620066e-06, | |
| "loss": 1.2232494354248047, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.1686746987951807, | |
| "grad_norm": 4.562730312347412, | |
| "learning_rate": 9.858682022742896e-06, | |
| "loss": 1.1690594673156738, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.17269076305220885, | |
| "grad_norm": 4.388287544250488, | |
| "learning_rate": 9.84165826691602e-06, | |
| "loss": 1.1833030700683593, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.17670682730923695, | |
| "grad_norm": 4.246683120727539, | |
| "learning_rate": 9.82368302366461e-06, | |
| "loss": 1.180044174194336, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.18072289156626506, | |
| "grad_norm": 6.267792224884033, | |
| "learning_rate": 9.804759825501074e-06, | |
| "loss": 1.1597715377807618, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.18072289156626506, | |
| "eval_loss": 1.1618536710739136, | |
| "eval_runtime": 224.0476, | |
| "eval_samples_per_second": 17.09, | |
| "eval_steps_per_second": 0.536, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.18473895582329317, | |
| "grad_norm": 5.484806537628174, | |
| "learning_rate": 9.784892391230847e-06, | |
| "loss": 1.161270809173584, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.18875502008032127, | |
| "grad_norm": 6.800451278686523, | |
| "learning_rate": 9.76408462522157e-06, | |
| "loss": 1.1662689208984376, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.1927710843373494, | |
| "grad_norm": 4.338923931121826, | |
| "learning_rate": 9.742340616635799e-06, | |
| "loss": 1.1915185928344727, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.19678714859437751, | |
| "grad_norm": 4.900355815887451, | |
| "learning_rate": 9.719664638627395e-06, | |
| "loss": 1.179362964630127, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.20080321285140562, | |
| "grad_norm": 13.36780071258545, | |
| "learning_rate": 9.69606114750177e-06, | |
| "loss": 1.136868953704834, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.20080321285140562, | |
| "eval_loss": 1.167843222618103, | |
| "eval_runtime": 224.0503, | |
| "eval_samples_per_second": 17.09, | |
| "eval_steps_per_second": 0.536, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.20481927710843373, | |
| "grad_norm": 5.8057098388671875, | |
| "learning_rate": 9.671534781840113e-06, | |
| "loss": 1.1644049644470216, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.20883534136546184, | |
| "grad_norm": 4.812023639678955, | |
| "learning_rate": 9.646090361587828e-06, | |
| "loss": 1.1246587753295898, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.21285140562248997, | |
| "grad_norm": 4.429294109344482, | |
| "learning_rate": 9.619732887107299e-06, | |
| "loss": 1.1263324737548828, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.21686746987951808, | |
| "grad_norm": 4.260849952697754, | |
| "learning_rate": 9.592467538195229e-06, | |
| "loss": 1.118002223968506, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.22088353413654618, | |
| "grad_norm": 4.285832405090332, | |
| "learning_rate": 9.56429967306469e-06, | |
| "loss": 1.1537700653076173, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.22088353413654618, | |
| "eval_loss": 1.1320561170578003, | |
| "eval_runtime": 224.168, | |
| "eval_samples_per_second": 17.081, | |
| "eval_steps_per_second": 0.535, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.2248995983935743, | |
| "grad_norm": 5.736870288848877, | |
| "learning_rate": 9.535234827292124e-06, | |
| "loss": 1.1374141693115234, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.2289156626506024, | |
| "grad_norm": 4.176708221435547, | |
| "learning_rate": 9.505278712729489e-06, | |
| "loss": 1.1468097686767578, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.23293172690763053, | |
| "grad_norm": 4.040938854217529, | |
| "learning_rate": 9.474437216381756e-06, | |
| "loss": 1.132613754272461, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.23694779116465864, | |
| "grad_norm": 4.140848159790039, | |
| "learning_rate": 9.442716399249995e-06, | |
| "loss": 1.1381197929382325, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.24096385542168675, | |
| "grad_norm": 3.8142037391662598, | |
| "learning_rate": 9.410122495140257e-06, | |
| "loss": 1.1367318153381347, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.24096385542168675, | |
| "eval_loss": 1.1217604875564575, | |
| "eval_runtime": 224.0839, | |
| "eval_samples_per_second": 17.087, | |
| "eval_steps_per_second": 0.536, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.24497991967871485, | |
| "grad_norm": 3.871077299118042, | |
| "learning_rate": 9.376661909438496e-06, | |
| "loss": 1.1195713043212892, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.24899598393574296, | |
| "grad_norm": 5.430377960205078, | |
| "learning_rate": 9.342341217851791e-06, | |
| "loss": 1.1373143196105957, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.25301204819277107, | |
| "grad_norm": 6.021585464477539, | |
| "learning_rate": 9.307167165116062e-06, | |
| "loss": 1.1249177932739258, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.2570281124497992, | |
| "grad_norm": 4.557471752166748, | |
| "learning_rate": 9.271146663670605e-06, | |
| "loss": 1.1521922111511231, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.26104417670682734, | |
| "grad_norm": 3.8892979621887207, | |
| "learning_rate": 9.23428679229964e-06, | |
| "loss": 1.138702964782715, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.26104417670682734, | |
| "eval_loss": 1.1032555103302002, | |
| "eval_runtime": 224.1346, | |
| "eval_samples_per_second": 17.083, | |
| "eval_steps_per_second": 0.535, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.26506024096385544, | |
| "grad_norm": 4.048600673675537, | |
| "learning_rate": 9.196594794741193e-06, | |
| "loss": 1.1215006828308105, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.26907630522088355, | |
| "grad_norm": 4.088984966278076, | |
| "learning_rate": 9.158078078263536e-06, | |
| "loss": 1.1247024536132812, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.27309236947791166, | |
| "grad_norm": 6.832698822021484, | |
| "learning_rate": 9.118744212209516e-06, | |
| "loss": 1.1253211975097657, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.27710843373493976, | |
| "grad_norm": 4.244821071624756, | |
| "learning_rate": 9.078600926509013e-06, | |
| "loss": 1.1232710838317872, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.28112449799196787, | |
| "grad_norm": 4.204834938049316, | |
| "learning_rate": 9.03765611015985e-06, | |
| "loss": 1.1257820129394531, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.28112449799196787, | |
| "eval_loss": 1.099267840385437, | |
| "eval_runtime": 224.1775, | |
| "eval_samples_per_second": 17.08, | |
| "eval_steps_per_second": 0.535, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.285140562248996, | |
| "grad_norm": 13.570015907287598, | |
| "learning_rate": 8.995917809677437e-06, | |
| "loss": 1.120689582824707, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.2891566265060241, | |
| "grad_norm": 4.013745307922363, | |
| "learning_rate": 8.953394227513463e-06, | |
| "loss": 1.0989994049072265, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.2931726907630522, | |
| "grad_norm": 4.636791229248047, | |
| "learning_rate": 8.910093720443945e-06, | |
| "loss": 1.0785343170166015, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.2971887550200803, | |
| "grad_norm": 5.258622169494629, | |
| "learning_rate": 8.866024797926936e-06, | |
| "loss": 1.1059405326843261, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.30120481927710846, | |
| "grad_norm": 4.196040630340576, | |
| "learning_rate": 8.821196120430252e-06, | |
| "loss": 1.1153934478759766, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.30120481927710846, | |
| "eval_loss": 1.0958428382873535, | |
| "eval_runtime": 224.2589, | |
| "eval_samples_per_second": 17.074, | |
| "eval_steps_per_second": 0.535, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.30522088353413657, | |
| "grad_norm": 4.448573589324951, | |
| "learning_rate": 8.775616497729502e-06, | |
| "loss": 1.1181120872497559, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.3092369477911647, | |
| "grad_norm": 5.079808712005615, | |
| "learning_rate": 8.729294887176778e-06, | |
| "loss": 1.0942277908325195, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.3132530120481928, | |
| "grad_norm": 3.968134641647339, | |
| "learning_rate": 8.682240391940355e-06, | |
| "loss": 1.0744555473327637, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.3172690763052209, | |
| "grad_norm": 4.138976573944092, | |
| "learning_rate": 8.634462259215719e-06, | |
| "loss": 1.1014032363891602, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.321285140562249, | |
| "grad_norm": 3.7669668197631836, | |
| "learning_rate": 8.58596987840831e-06, | |
| "loss": 1.1038568496704102, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.321285140562249, | |
| "eval_loss": 1.0854790210723877, | |
| "eval_runtime": 224.3132, | |
| "eval_samples_per_second": 17.07, | |
| "eval_steps_per_second": 0.535, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.3253012048192771, | |
| "grad_norm": 3.8699982166290283, | |
| "learning_rate": 8.536772779288297e-06, | |
| "loss": 1.1016878128051757, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.3293172690763052, | |
| "grad_norm": 4.875065326690674, | |
| "learning_rate": 8.48688063011778e-06, | |
| "loss": 1.0864307403564453, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.3333333333333333, | |
| "grad_norm": 3.7264904975891113, | |
| "learning_rate": 8.43630323575078e-06, | |
| "loss": 1.084289836883545, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.3373493975903614, | |
| "grad_norm": 3.7510852813720703, | |
| "learning_rate": 8.385050535706376e-06, | |
| "loss": 1.1047092437744142, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.3413654618473896, | |
| "grad_norm": 3.7756431102752686, | |
| "learning_rate": 8.333132602215374e-06, | |
| "loss": 1.0681782722473145, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.3413654618473896, | |
| "eval_loss": 1.0816028118133545, | |
| "eval_runtime": 224.2437, | |
| "eval_samples_per_second": 17.075, | |
| "eval_steps_per_second": 0.535, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.3453815261044177, | |
| "grad_norm": 4.321180820465088, | |
| "learning_rate": 8.280559638240914e-06, | |
| "loss": 1.076450252532959, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.3493975903614458, | |
| "grad_norm": 5.125402927398682, | |
| "learning_rate": 8.227341975473368e-06, | |
| "loss": 1.1018122673034667, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.3534136546184739, | |
| "grad_norm": 4.057586193084717, | |
| "learning_rate": 8.17349007229994e-06, | |
| "loss": 1.0766830444335938, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.357429718875502, | |
| "grad_norm": 3.9465365409851074, | |
| "learning_rate": 8.119014511749388e-06, | |
| "loss": 1.0568387985229493, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.3614457831325301, | |
| "grad_norm": 5.671834468841553, | |
| "learning_rate": 8.063925999412224e-06, | |
| "loss": 1.064396286010742, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.3614457831325301, | |
| "eval_loss": 1.0756299495697021, | |
| "eval_runtime": 224.2054, | |
| "eval_samples_per_second": 17.078, | |
| "eval_steps_per_second": 0.535, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.3654618473895582, | |
| "grad_norm": 3.911022901535034, | |
| "learning_rate": 8.008235361336845e-06, | |
| "loss": 1.1032384872436523, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.36947791164658633, | |
| "grad_norm": 3.855924129486084, | |
| "learning_rate": 7.951953541901989e-06, | |
| "loss": 1.0686886787414551, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.37349397590361444, | |
| "grad_norm": 4.947168827056885, | |
| "learning_rate": 7.895091601665934e-06, | |
| "loss": 1.0647593498229981, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.37751004016064255, | |
| "grad_norm": 4.119925022125244, | |
| "learning_rate": 7.837660715192867e-06, | |
| "loss": 1.0522316932678222, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.3815261044176707, | |
| "grad_norm": 3.602022647857666, | |
| "learning_rate": 7.779672168856844e-06, | |
| "loss": 1.0513050079345703, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.3815261044176707, | |
| "eval_loss": 1.0680068731307983, | |
| "eval_runtime": 224.3211, | |
| "eval_samples_per_second": 17.069, | |
| "eval_steps_per_second": 0.535, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.3855421686746988, | |
| "grad_norm": 4.18943452835083, | |
| "learning_rate": 7.721137358623786e-06, | |
| "loss": 1.0850586891174316, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.3895582329317269, | |
| "grad_norm": 6.430990219116211, | |
| "learning_rate": 7.66206778781193e-06, | |
| "loss": 1.0583345413208007, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.39357429718875503, | |
| "grad_norm": 4.619312286376953, | |
| "learning_rate": 7.6024750648311805e-06, | |
| "loss": 1.091839599609375, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.39759036144578314, | |
| "grad_norm": 3.8781845569610596, | |
| "learning_rate": 7.542370900901827e-06, | |
| "loss": 1.0620054244995116, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.40160642570281124, | |
| "grad_norm": 3.7595436573028564, | |
| "learning_rate": 7.4817671077530295e-06, | |
| "loss": 1.0398008346557617, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.40160642570281124, | |
| "eval_loss": 1.0621941089630127, | |
| "eval_runtime": 224.1744, | |
| "eval_samples_per_second": 17.08, | |
| "eval_steps_per_second": 0.535, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.40562248995983935, | |
| "grad_norm": 3.890206813812256, | |
| "learning_rate": 7.420675595301574e-06, | |
| "loss": 1.067855453491211, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.40963855421686746, | |
| "grad_norm": 3.8331494331359863, | |
| "learning_rate": 7.359108369311318e-06, | |
| "loss": 1.0873468399047852, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.41365461847389556, | |
| "grad_norm": 3.785521984100342, | |
| "learning_rate": 7.297077529033814e-06, | |
| "loss": 1.0355330467224122, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.41767068273092367, | |
| "grad_norm": 6.754027843475342, | |
| "learning_rate": 7.234595264830546e-06, | |
| "loss": 1.0717147827148437, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.42168674698795183, | |
| "grad_norm": 3.619626045227051, | |
| "learning_rate": 7.171673855777271e-06, | |
| "loss": 1.0628927230834961, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.42168674698795183, | |
| "eval_loss": 1.0565131902694702, | |
| "eval_runtime": 224.3026, | |
| "eval_samples_per_second": 17.071, | |
| "eval_steps_per_second": 0.535, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.42570281124497994, | |
| "grad_norm": 3.654301404953003, | |
| "learning_rate": 7.10832566725092e-06, | |
| "loss": 1.028466033935547, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.42971887550200805, | |
| "grad_norm": 4.81827449798584, | |
| "learning_rate": 7.044563148499547e-06, | |
| "loss": 1.0777903556823731, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.43373493975903615, | |
| "grad_norm": 4.028594493865967, | |
| "learning_rate": 6.980398830195785e-06, | |
| "loss": 1.1094385147094727, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.43775100401606426, | |
| "grad_norm": 3.782311201095581, | |
| "learning_rate": 6.915845321974309e-06, | |
| "loss": 1.0568254470825196, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.44176706827309237, | |
| "grad_norm": 4.213383197784424, | |
| "learning_rate": 6.85091530995378e-06, | |
| "loss": 1.0806368827819823, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.44176706827309237, | |
| "eval_loss": 1.0501891374588013, | |
| "eval_runtime": 224.1605, | |
| "eval_samples_per_second": 17.082, | |
| "eval_steps_per_second": 0.535, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.4457831325301205, | |
| "grad_norm": 3.598494529724121, | |
| "learning_rate": 6.785621554243752e-06, | |
| "loss": 1.0479291915893554, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.4497991967871486, | |
| "grad_norm": 3.8993070125579834, | |
| "learning_rate": 6.7199768864370455e-06, | |
| "loss": 1.066202163696289, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.4538152610441767, | |
| "grad_norm": 4.1509833335876465, | |
| "learning_rate": 6.65399420708807e-06, | |
| "loss": 1.0448795318603517, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.4578313253012048, | |
| "grad_norm": 3.5259952545166016, | |
| "learning_rate": 6.587686483177596e-06, | |
| "loss": 1.049018383026123, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.46184738955823296, | |
| "grad_norm": 3.395838975906372, | |
| "learning_rate": 6.521066745564467e-06, | |
| "loss": 1.0418387413024903, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.46184738955823296, | |
| "eval_loss": 1.0448716878890991, | |
| "eval_runtime": 224.2692, | |
| "eval_samples_per_second": 17.073, | |
| "eval_steps_per_second": 0.535, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.46586345381526106, | |
| "grad_norm": 5.678968906402588, | |
| "learning_rate": 6.454148086424767e-06, | |
| "loss": 1.0376011848449707, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.46987951807228917, | |
| "grad_norm": 4.015078067779541, | |
| "learning_rate": 6.38694365667893e-06, | |
| "loss": 1.0441588401794433, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.4738955823293173, | |
| "grad_norm": 4.168111324310303, | |
| "learning_rate": 6.319466663407309e-06, | |
| "loss": 1.0368056297302246, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.4779116465863454, | |
| "grad_norm": 5.260632038116455, | |
| "learning_rate": 6.251730367254708e-06, | |
| "loss": 1.0322036743164062, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.4819277108433735, | |
| "grad_norm": 3.426922082901001, | |
| "learning_rate": 6.1837480798243894e-06, | |
| "loss": 1.0827327728271485, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.4819277108433735, | |
| "eval_loss": 1.0421009063720703, | |
| "eval_runtime": 224.3064, | |
| "eval_samples_per_second": 17.07, | |
| "eval_steps_per_second": 0.535, | |
| "step": 1200 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 2490, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 8.318144766541824e+17, | |
| "train_batch_size": 32, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |