Instructions to use CodeIsAbstract/HybridTimeScaleModel with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use CodeIsAbstract/HybridTimeScaleModel with Transformers:
# Load model directly from transformers import HybridFourierLM model = HybridFourierLM.from_pretrained("CodeIsAbstract/HybridTimeScaleModel", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Training in progress, step 76000, checkpoint
Browse files
last-checkpoint/model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 469337272
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:2a187dee5bccd16e94b5ab10c8dee4691190193326142bcafb73a0a6eb058d93
|
| 3 |
size 469337272
|
last-checkpoint/optimizer.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 938825803
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4576b4611184440e8e89546d8dcec0928f3f749f9bd7cd9939158be70b4eeb74
|
| 3 |
size 938825803
|
last-checkpoint/rng_state.pth
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 14645
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:375646414b14bb81be31b058ed8af728ea3d95a2e32dca6c4303eaf631e462ed
|
| 3 |
size 14645
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4abf2f313f27bccac25e9c8e915c70451aa8583b1fd70999a373943c42410d5b
|
| 3 |
size 1465
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -2,9 +2,9 @@
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
-
"epoch": 0.
|
| 6 |
"eval_steps": 1000,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -5624,6 +5624,318 @@
|
|
| 5624 |
"eval_samples_per_second": 77.729,
|
| 5625 |
"eval_steps_per_second": 19.432,
|
| 5626 |
"step": 72000
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 5627 |
}
|
| 5628 |
],
|
| 5629 |
"logging_steps": 100,
|
|
@@ -5643,7 +5955,7 @@
|
|
| 5643 |
"attributes": {}
|
| 5644 |
}
|
| 5645 |
},
|
| 5646 |
-
"total_flos": 1.
|
| 5647 |
"train_batch_size": 22,
|
| 5648 |
"trial_name": null,
|
| 5649 |
"trial_params": null
|
|
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.36363636363636365,
|
| 6 |
"eval_steps": 1000,
|
| 7 |
+
"global_step": 76000,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 5624 |
"eval_samples_per_second": 77.729,
|
| 5625 |
"eval_steps_per_second": 19.432,
|
| 5626 |
"step": 72000
|
| 5627 |
+
},
|
| 5628 |
+
{
|
| 5629 |
+
"epoch": 0.3281818181818182,
|
| 5630 |
+
"grad_norm": 0.15797623991966248,
|
| 5631 |
+
"learning_rate": 0.0002660698463785552,
|
| 5632 |
+
"loss": 2.619053955078125,
|
| 5633 |
+
"step": 72100
|
| 5634 |
+
},
|
| 5635 |
+
{
|
| 5636 |
+
"epoch": 0.3290909090909091,
|
| 5637 |
+
"grad_norm": 0.1555212438106537,
|
| 5638 |
+
"learning_rate": 0.0002648070144895005,
|
| 5639 |
+
"loss": 2.632798156738281,
|
| 5640 |
+
"step": 72200
|
| 5641 |
+
},
|
| 5642 |
+
{
|
| 5643 |
+
"epoch": 0.33,
|
| 5644 |
+
"grad_norm": 0.19114950299263,
|
| 5645 |
+
"learning_rate": 0.00026354610623997046,
|
| 5646 |
+
"loss": 2.6581826782226563,
|
| 5647 |
+
"step": 72300
|
| 5648 |
+
},
|
| 5649 |
+
{
|
| 5650 |
+
"epoch": 0.33090909090909093,
|
| 5651 |
+
"grad_norm": 0.17001217603683472,
|
| 5652 |
+
"learning_rate": 0.00026228713194291253,
|
| 5653 |
+
"loss": 2.65262939453125,
|
| 5654 |
+
"step": 72400
|
| 5655 |
+
},
|
| 5656 |
+
{
|
| 5657 |
+
"epoch": 0.33181818181818185,
|
| 5658 |
+
"grad_norm": 0.1753956377506256,
|
| 5659 |
+
"learning_rate": 0.0002610301018954573,
|
| 5660 |
+
"loss": 2.6327615356445313,
|
| 5661 |
+
"step": 72500
|
| 5662 |
+
},
|
| 5663 |
+
{
|
| 5664 |
+
"epoch": 0.3327272727272727,
|
| 5665 |
+
"grad_norm": 0.19001173973083496,
|
| 5666 |
+
"learning_rate": 0.00025977502637883234,
|
| 5667 |
+
"loss": 2.6356915283203124,
|
| 5668 |
+
"step": 72600
|
| 5669 |
+
},
|
| 5670 |
+
{
|
| 5671 |
+
"epoch": 0.3336363636363636,
|
| 5672 |
+
"grad_norm": 0.17613352835178375,
|
| 5673 |
+
"learning_rate": 0.00025852191565827934,
|
| 5674 |
+
"loss": 2.6278375244140624,
|
| 5675 |
+
"step": 72700
|
| 5676 |
+
},
|
| 5677 |
+
{
|
| 5678 |
+
"epoch": 0.33454545454545453,
|
| 5679 |
+
"grad_norm": 0.16500087082386017,
|
| 5680 |
+
"learning_rate": 0.0002572707799829701,
|
| 5681 |
+
"loss": 2.6458389282226564,
|
| 5682 |
+
"step": 72800
|
| 5683 |
+
},
|
| 5684 |
+
{
|
| 5685 |
+
"epoch": 0.33545454545454545,
|
| 5686 |
+
"grad_norm": 0.16459618508815765,
|
| 5687 |
+
"learning_rate": 0.00025602162958592256,
|
| 5688 |
+
"loss": 2.6154913330078124,
|
| 5689 |
+
"step": 72900
|
| 5690 |
+
},
|
| 5691 |
+
{
|
| 5692 |
+
"epoch": 0.33636363636363636,
|
| 5693 |
+
"grad_norm": 0.16172908246517181,
|
| 5694 |
+
"learning_rate": 0.0002547744746839172,
|
| 5695 |
+
"loss": 2.617068176269531,
|
| 5696 |
+
"step": 73000
|
| 5697 |
+
},
|
| 5698 |
+
{
|
| 5699 |
+
"epoch": 0.33636363636363636,
|
| 5700 |
+
"eval_loss": 3.033856153488159,
|
| 5701 |
+
"eval_runtime": 7.4432,
|
| 5702 |
+
"eval_samples_per_second": 77.386,
|
| 5703 |
+
"eval_steps_per_second": 19.346,
|
| 5704 |
+
"step": 73000
|
| 5705 |
+
},
|
| 5706 |
+
{
|
| 5707 |
+
"epoch": 0.3372727272727273,
|
| 5708 |
+
"grad_norm": 0.1543026864528656,
|
| 5709 |
+
"learning_rate": 0.0002535293254774134,
|
| 5710 |
+
"loss": 2.626250915527344,
|
| 5711 |
+
"step": 73100
|
| 5712 |
+
},
|
| 5713 |
+
{
|
| 5714 |
+
"epoch": 0.3381818181818182,
|
| 5715 |
+
"grad_norm": 0.1827453225851059,
|
| 5716 |
+
"learning_rate": 0.00025228619215046546,
|
| 5717 |
+
"loss": 2.6261016845703127,
|
| 5718 |
+
"step": 73200
|
| 5719 |
+
},
|
| 5720 |
+
{
|
| 5721 |
+
"epoch": 0.3390909090909091,
|
| 5722 |
+
"grad_norm": 0.1937389373779297,
|
| 5723 |
+
"learning_rate": 0.0002510450848706404,
|
| 5724 |
+
"loss": 2.6204208374023437,
|
| 5725 |
+
"step": 73300
|
| 5726 |
+
},
|
| 5727 |
+
{
|
| 5728 |
+
"epoch": 0.34,
|
| 5729 |
+
"grad_norm": 0.17227666079998016,
|
| 5730 |
+
"learning_rate": 0.000249806013788934,
|
| 5731 |
+
"loss": 2.6471063232421876,
|
| 5732 |
+
"step": 73400
|
| 5733 |
+
},
|
| 5734 |
+
{
|
| 5735 |
+
"epoch": 0.3409090909090909,
|
| 5736 |
+
"grad_norm": 0.17451529204845428,
|
| 5737 |
+
"learning_rate": 0.00024856898903968843,
|
| 5738 |
+
"loss": 2.6337734985351564,
|
| 5739 |
+
"step": 73500
|
| 5740 |
+
},
|
| 5741 |
+
{
|
| 5742 |
+
"epoch": 0.3418181818181818,
|
| 5743 |
+
"grad_norm": 0.24337761104106903,
|
| 5744 |
+
"learning_rate": 0.00024733402074050815,
|
| 5745 |
+
"loss": 2.6101370239257813,
|
| 5746 |
+
"step": 73600
|
| 5747 |
+
},
|
| 5748 |
+
{
|
| 5749 |
+
"epoch": 0.3427272727272727,
|
| 5750 |
+
"grad_norm": 0.14900852739810944,
|
| 5751 |
+
"learning_rate": 0.00024610111899217845,
|
| 5752 |
+
"loss": 2.64669677734375,
|
| 5753 |
+
"step": 73700
|
| 5754 |
+
},
|
| 5755 |
+
{
|
| 5756 |
+
"epoch": 0.34363636363636363,
|
| 5757 |
+
"grad_norm": 0.15780414640903473,
|
| 5758 |
+
"learning_rate": 0.0002448702938785824,
|
| 5759 |
+
"loss": 2.61236328125,
|
| 5760 |
+
"step": 73800
|
| 5761 |
+
},
|
| 5762 |
+
{
|
| 5763 |
+
"epoch": 0.34454545454545454,
|
| 5764 |
+
"grad_norm": 0.194599449634552,
|
| 5765 |
+
"learning_rate": 0.0002436415554666181,
|
| 5766 |
+
"loss": 2.603551940917969,
|
| 5767 |
+
"step": 73900
|
| 5768 |
+
},
|
| 5769 |
+
{
|
| 5770 |
+
"epoch": 0.34545454545454546,
|
| 5771 |
+
"grad_norm": 0.14722345769405365,
|
| 5772 |
+
"learning_rate": 0.0002424149138061168,
|
| 5773 |
+
"loss": 2.613863220214844,
|
| 5774 |
+
"step": 74000
|
| 5775 |
+
},
|
| 5776 |
+
{
|
| 5777 |
+
"epoch": 0.34545454545454546,
|
| 5778 |
+
"eval_loss": 3.027711868286133,
|
| 5779 |
+
"eval_runtime": 7.4441,
|
| 5780 |
+
"eval_samples_per_second": 77.376,
|
| 5781 |
+
"eval_steps_per_second": 19.344,
|
| 5782 |
+
"step": 74000
|
| 5783 |
+
},
|
| 5784 |
+
{
|
| 5785 |
+
"epoch": 0.3463636363636364,
|
| 5786 |
+
"grad_norm": 0.1645086705684662,
|
| 5787 |
+
"learning_rate": 0.00024119037892975998,
|
| 5788 |
+
"loss": 2.59792724609375,
|
| 5789 |
+
"step": 74100
|
| 5790 |
+
},
|
| 5791 |
+
{
|
| 5792 |
+
"epoch": 0.3472727272727273,
|
| 5793 |
+
"grad_norm": 0.1647663712501526,
|
| 5794 |
+
"learning_rate": 0.00023996796085299821,
|
| 5795 |
+
"loss": 2.611474609375,
|
| 5796 |
+
"step": 74200
|
| 5797 |
+
},
|
| 5798 |
+
{
|
| 5799 |
+
"epoch": 0.3481818181818182,
|
| 5800 |
+
"grad_norm": 0.17553652822971344,
|
| 5801 |
+
"learning_rate": 0.0002387476695739687,
|
| 5802 |
+
"loss": 2.6507049560546876,
|
| 5803 |
+
"step": 74300
|
| 5804 |
+
},
|
| 5805 |
+
{
|
| 5806 |
+
"epoch": 0.3490909090909091,
|
| 5807 |
+
"grad_norm": 0.15945149958133698,
|
| 5808 |
+
"learning_rate": 0.00023752951507341352,
|
| 5809 |
+
"loss": 2.643914794921875,
|
| 5810 |
+
"step": 74400
|
| 5811 |
+
},
|
| 5812 |
+
{
|
| 5813 |
+
"epoch": 0.35,
|
| 5814 |
+
"grad_norm": 0.16624271869659424,
|
| 5815 |
+
"learning_rate": 0.00023631350731459827,
|
| 5816 |
+
"loss": 2.641552734375,
|
| 5817 |
+
"step": 74500
|
| 5818 |
+
},
|
| 5819 |
+
{
|
| 5820 |
+
"epoch": 0.3509090909090909,
|
| 5821 |
+
"grad_norm": 0.15819379687309265,
|
| 5822 |
+
"learning_rate": 0.00023509965624322993,
|
| 5823 |
+
"loss": 2.5745086669921875,
|
| 5824 |
+
"step": 74600
|
| 5825 |
+
},
|
| 5826 |
+
{
|
| 5827 |
+
"epoch": 0.3518181818181818,
|
| 5828 |
+
"grad_norm": 0.17103050649166107,
|
| 5829 |
+
"learning_rate": 0.00023388797178737635,
|
| 5830 |
+
"loss": 2.5839889526367186,
|
| 5831 |
+
"step": 74700
|
| 5832 |
+
},
|
| 5833 |
+
{
|
| 5834 |
+
"epoch": 0.3527272727272727,
|
| 5835 |
+
"grad_norm": 0.17305444180965424,
|
| 5836 |
+
"learning_rate": 0.00023267846385738474,
|
| 5837 |
+
"loss": 2.610628662109375,
|
| 5838 |
+
"step": 74800
|
| 5839 |
+
},
|
| 5840 |
+
{
|
| 5841 |
+
"epoch": 0.35363636363636364,
|
| 5842 |
+
"grad_norm": 0.19914712011814117,
|
| 5843 |
+
"learning_rate": 0.00023147114234580023,
|
| 5844 |
+
"loss": 2.6196224975585936,
|
| 5845 |
+
"step": 74900
|
| 5846 |
+
},
|
| 5847 |
+
{
|
| 5848 |
+
"epoch": 0.35454545454545455,
|
| 5849 |
+
"grad_norm": 0.15575388073921204,
|
| 5850 |
+
"learning_rate": 0.00023026601712728567,
|
| 5851 |
+
"loss": 2.590400390625,
|
| 5852 |
+
"step": 75000
|
| 5853 |
+
},
|
| 5854 |
+
{
|
| 5855 |
+
"epoch": 0.35454545454545455,
|
| 5856 |
+
"eval_loss": 3.025919198989868,
|
| 5857 |
+
"eval_runtime": 7.4339,
|
| 5858 |
+
"eval_samples_per_second": 77.483,
|
| 5859 |
+
"eval_steps_per_second": 19.371,
|
| 5860 |
+
"step": 75000
|
| 5861 |
+
},
|
| 5862 |
+
{
|
| 5863 |
+
"epoch": 0.35545454545454547,
|
| 5864 |
+
"grad_norm": 0.16681872308254242,
|
| 5865 |
+
"learning_rate": 0.00022906309805853986,
|
| 5866 |
+
"loss": 2.60665771484375,
|
| 5867 |
+
"step": 75100
|
| 5868 |
+
},
|
| 5869 |
+
{
|
| 5870 |
+
"epoch": 0.3563636363636364,
|
| 5871 |
+
"grad_norm": 0.18523137271404266,
|
| 5872 |
+
"learning_rate": 0.00022786239497821808,
|
| 5873 |
+
"loss": 2.613553771972656,
|
| 5874 |
+
"step": 75200
|
| 5875 |
+
},
|
| 5876 |
+
{
|
| 5877 |
+
"epoch": 0.3572727272727273,
|
| 5878 |
+
"grad_norm": 0.18534353375434875,
|
| 5879 |
+
"learning_rate": 0.0002266639177068509,
|
| 5880 |
+
"loss": 2.6336288452148438,
|
| 5881 |
+
"step": 75300
|
| 5882 |
+
},
|
| 5883 |
+
{
|
| 5884 |
+
"epoch": 0.35818181818181816,
|
| 5885 |
+
"grad_norm": 0.17340436577796936,
|
| 5886 |
+
"learning_rate": 0.00022546767604676398,
|
| 5887 |
+
"loss": 2.596582336425781,
|
| 5888 |
+
"step": 75400
|
| 5889 |
+
},
|
| 5890 |
+
{
|
| 5891 |
+
"epoch": 0.35909090909090907,
|
| 5892 |
+
"grad_norm": 0.15971297025680542,
|
| 5893 |
+
"learning_rate": 0.00022427367978199804,
|
| 5894 |
+
"loss": 2.629716491699219,
|
| 5895 |
+
"step": 75500
|
| 5896 |
+
},
|
| 5897 |
+
{
|
| 5898 |
+
"epoch": 0.36,
|
| 5899 |
+
"grad_norm": 0.17461271584033966,
|
| 5900 |
+
"learning_rate": 0.00022308193867822873,
|
| 5901 |
+
"loss": 2.613475341796875,
|
| 5902 |
+
"step": 75600
|
| 5903 |
+
},
|
| 5904 |
+
{
|
| 5905 |
+
"epoch": 0.3609090909090909,
|
| 5906 |
+
"grad_norm": 0.169435515999794,
|
| 5907 |
+
"learning_rate": 0.00022189246248268673,
|
| 5908 |
+
"loss": 2.597880859375,
|
| 5909 |
+
"step": 75700
|
| 5910 |
+
},
|
| 5911 |
+
{
|
| 5912 |
+
"epoch": 0.3618181818181818,
|
| 5913 |
+
"grad_norm": 0.17688947916030884,
|
| 5914 |
+
"learning_rate": 0.00022070526092407835,
|
| 5915 |
+
"loss": 2.589518737792969,
|
| 5916 |
+
"step": 75800
|
| 5917 |
+
},
|
| 5918 |
+
{
|
| 5919 |
+
"epoch": 0.36272727272727273,
|
| 5920 |
+
"grad_norm": 0.1569153070449829,
|
| 5921 |
+
"learning_rate": 0.0002195203437125049,
|
| 5922 |
+
"loss": 2.6041824340820314,
|
| 5923 |
+
"step": 75900
|
| 5924 |
+
},
|
| 5925 |
+
{
|
| 5926 |
+
"epoch": 0.36363636363636365,
|
| 5927 |
+
"grad_norm": 0.1733204573392868,
|
| 5928 |
+
"learning_rate": 0.00021833772053938495,
|
| 5929 |
+
"loss": 2.594022521972656,
|
| 5930 |
+
"step": 76000
|
| 5931 |
+
},
|
| 5932 |
+
{
|
| 5933 |
+
"epoch": 0.36363636363636365,
|
| 5934 |
+
"eval_loss": 3.0241539478302,
|
| 5935 |
+
"eval_runtime": 7.4745,
|
| 5936 |
+
"eval_samples_per_second": 77.062,
|
| 5937 |
+
"eval_steps_per_second": 19.266,
|
| 5938 |
+
"step": 76000
|
| 5939 |
}
|
| 5940 |
],
|
| 5941 |
"logging_steps": 100,
|
|
|
|
| 5955 |
"attributes": {}
|
| 5956 |
}
|
| 5957 |
},
|
| 5958 |
+
"total_flos": 1.893508155703296e+18,
|
| 5959 |
"train_batch_size": 22,
|
| 5960 |
"trial_name": null,
|
| 5961 |
"trial_params": null
|