cstr commited on Apr 22, 2024

Commit

75ce5a7

•

1 Parent(s): c00fcd8

Upload folder using huggingface_hub

Browse files

Files changed (16) hide show

README.md +15 -21
config.json +4 -5
mergekit_config.yml +17 -14
model-00001-of-00009.safetensors +2 -2
model-00002-of-00009.safetensors +2 -2
model-00003-of-00009.safetensors +2 -2
model-00004-of-00009.safetensors +2 -2
model-00005-of-00009.safetensors +2 -2
model-00006-of-00009.safetensors +1 -1
model-00007-of-00009.safetensors +2 -2
model-00008-of-00009.safetensors +2 -2
model-00009-of-00009.safetensors +2 -2
model.safetensors.index.json +1 -1
special_tokens_map.json +3 -7
tokenizer.json +16 -20
tokenizer_config.json +12 -25

README.md CHANGED Viewed

@@ -3,47 +3,41 @@ tags:
 - merge
 - mergekit
 - lazymergekit
-- abhishek/autotrain-llama3-8b-open-hermes-sft
-- cognitivecomputations/dolphin-2.9-llama3-8b
 - DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental
 base_model:
-- abhishek/autotrain-llama3-8b-open-hermes-sft
-- cognitivecomputations/dolphin-2.9-llama3-8b
 - DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental
 ---
 # llama3-discolm-orpo-t2
 llama3-discolm-orpo-t2 is a merge of the following models using [LazyMergekit](https://colab.research.google.com/drive/1obulZ1ROXHjYLn6PPZJwRR6GzgQogxxb?usp=sharing):
-* [abhishek/autotrain-llama3-8b-open-hermes-sft](https://huggingface.co/abhishek/autotrain-llama3-8b-open-hermes-sft)
-* [cognitivecomputations/dolphin-2.9-llama3-8b](https://huggingface.co/cognitivecomputations/dolphin-2.9-llama3-8b)
 * [DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental](https://huggingface.co/DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental)
 ## 🧩 Configuration
 ```yaml
 models:
-  - model: abhishek/autotrain-llama3-8b-open-hermes-sft
     parameters:
-      density: 0.5
-      weight: 0.4
-  - model: cognitivecomputations/dolphin-2.9-llama3-8b
-    parameters:
-      density: 0.5
-      weight: 0.3
   - model: DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental
     parameters:
-      density: 0.6
-      weight: [0, 0.3, 0.7, 1]
-#        - filter: mlp
-#          value: 0.5
-#        - value: 0.3
-merge_method: ties
-base_model: mlabonne/OrpoLlama-3-8B
 parameters:
-  normalize: true
   int8_mask: true
 dtype: bfloat16
 ```
 ## 💻 Usage

 - merge
 - mergekit
 - lazymergekit
+- Locutusque/llama-3-neural-chat-v1-8b
 - DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental
 base_model:
+- Locutusque/llama-3-neural-chat-v1-8b
 - DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental
 ---
 # llama3-discolm-orpo-t2
 llama3-discolm-orpo-t2 is a merge of the following models using [LazyMergekit](https://colab.research.google.com/drive/1obulZ1ROXHjYLn6PPZJwRR6GzgQogxxb?usp=sharing):
+* [Locutusque/llama-3-neural-chat-v1-8b](https://huggingface.co/Locutusque/llama-3-neural-chat-v1-8b)
 * [DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental](https://huggingface.co/DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental)
 ## 🧩 Configuration
 ```yaml
 models:
+  - model: Locutusque/Llama-3-Orca-1.0-8B
+    # no parameters necessary for base model
+  - model: Locutusque/llama-3-neural-chat-v1-8b
     parameters:
+      density: 0.60
+      weight: 0.15
   - model: DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental
     parameters:
+      density: 0.65
+      weight: 0.7
+merge_method: dare_ties
+base_model: Locutusque/Llama-3-Orca-1.0-8B
 parameters:
   int8_mask: true
 dtype: bfloat16
+random_seed: 0
+tokenizer_source: base
 ```
 ## 💻 Usage

config.json CHANGED Viewed

@@ -1,12 +1,12 @@
 {
-  "_name_or_path": "mlabonne/OrpoLlama-3-8B",
   "architectures": [
     "LlamaForCausalLM"
   ],
   "attention_bias": false,
   "attention_dropout": 0.0,
-  "bos_token_id": 128256,
-  "eos_token_id": 128257,
   "hidden_act": "silu",
   "hidden_size": 4096,
   "initializer_range": 0.02,
@@ -16,7 +16,6 @@
   "num_attention_heads": 32,
   "num_hidden_layers": 32,
   "num_key_value_heads": 8,
-  "pad_token_id": 128257,
   "pretraining_tp": 1,
   "rms_norm_eps": 1e-05,
   "rope_scaling": null,
@@ -25,5 +24,5 @@
   "torch_dtype": "bfloat16",
   "transformers_version": "4.39.3",
   "use_cache": true,
-  "vocab_size": 128258
 }

 {
+  "_name_or_path": "Locutusque/Llama-3-Orca-1.0-8B",
   "architectures": [
     "LlamaForCausalLM"
   ],
   "attention_bias": false,
   "attention_dropout": 0.0,
+  "bos_token_id": 128000,
+  "eos_token_id": 128001,
   "hidden_act": "silu",
   "hidden_size": 4096,
   "initializer_range": 0.02,
   "num_attention_heads": 32,
   "num_hidden_layers": 32,
   "num_key_value_heads": 8,
   "pretraining_tp": 1,
   "rms_norm_eps": 1e-05,
   "rope_scaling": null,
   "torch_dtype": "bfloat16",
   "transformers_version": "4.39.3",
   "use_cache": true,
+  "vocab_size": 128256
 }

mergekit_config.yml CHANGED Viewed

@@ -1,17 +1,20 @@
-slices:
-  - sources:
-      - model: mlabonne/OrpoLlama-3-8B
-        layer_range: [0, 32]
-      - model: DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental
-        layer_range: [0, 32]
-merge_method: slerp
-base_model: mlabonne/OrpoLlama-3-8B
 parameters:
-  t:
-    - filter: self_attn
-      value: [1, 0.7, 0.5, 0.3, 0.1]
-    - filter: mlp
-      value: [0, 0.3, 0.5, 0.7, 0.9]
-    - value: 0.5
 dtype: bfloat16

+models:
+  - model: Locutusque/Llama-3-Orca-1.0-8B
+    # no parameters necessary for base model
+  - model: Locutusque/llama-3-neural-chat-v1-8b
+    parameters:
+      density: 0.60
+      weight: 0.15
+  - model: DiscoResearch/Llama3_DiscoLM_German_8b_v0.1_experimental
+    parameters:
+      density: 0.65
+      weight: 0.7
+merge_method: dare_ties
+base_model: Locutusque/Llama-3-Orca-1.0-8B
 parameters:
+  int8_mask: true
 dtype: bfloat16
+random_seed: 0
+tokenizer_source: base

model-00001-of-00009.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:ea7dbe23c8a4216515c732d86d1d1dfbb9d7bcdc99adccf1dafff911d5d22fca
-size 1979781432

 version https://git-lfs.github.com/spec/v1
+oid sha256:cc30c136d6d9bbcf0c9914b7532d28a9380a299233a929a0658427516d192920
+size 1973455376

model-00002-of-00009.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:894dd03966f7d27772fd51b1b5953aa550ed75defc4a47f6231628dd6bf0a9c5
-size 1946243944

 version https://git-lfs.github.com/spec/v1
+oid sha256:78aa0ce8e2086002087b3b9144451aa84a20d0db8487d6019b6d607e548777f7
+size 1895895336

model-00003-of-00009.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:9e7fd0940e6b6b0ec61a6022e5fca54f0d35e46ac01ff8142dc93f7959a5e24c
-size 1923106776

 version https://git-lfs.github.com/spec/v1
+oid sha256:27c585c80dbfc08297f3ed35217684e2cbbb763cf6b1a88401a695b2a4aa29b7
+size 1979798040

model-00004-of-00009.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:0fd865707be249dc2979e496035dcd59c068fcb0075ea9031e60d289abeb989d
-size 1946243984

 version https://git-lfs.github.com/spec/v1
+oid sha256:6606b4a1fe0873adeff97a7e1e6e91a56feaddf70d1fc9dacd2edfdd51051972
+size 1946227368

model-00005-of-00009.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:f78e0dc55a781fe4eea66e6465e81c71592e88428bd03db5704ef84207cb7249
-size 1979781440

 version https://git-lfs.github.com/spec/v1
+oid sha256:921507a21f07fb31ddb57a506ead667f81a3e7851837d5c8fcb392febd46b0b6
+size 1979798064

model-00006-of-00009.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:e1e52389df2bfa658c1da3185dfbc248f28a776117d9985ba3b76180e487006f
 size 1946227368

 version https://git-lfs.github.com/spec/v1
+oid sha256:94a3cfdcbee86b0c580c0b1eda1a8fed858f28e3bbb1af99b0b721aa8e8f50f5
 size 1946227368

model-00007-of-00009.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:477275a21da2fd43d8dde246b534a8dfff0f1e2730467cb908c26f664d56fd09
-size 1979789776

 version https://git-lfs.github.com/spec/v1
+oid sha256:823c139db3ae4451a555bdd69076326daf61daf47b29a4cebc477e9a4b99e911
+size 1979806352

model-00008-of-00009.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:475d44f97f66ded653c2630210d5cf4789b84567eb107f53d47f79541aac926e
-size 1191242824

 version https://git-lfs.github.com/spec/v1
+oid sha256:cdb2ad44c84e8da8c6d56c92a3f8274e56d0b6dcb4fe7e08f967ef1394334055
+size 1308675136

model-00009-of-00009.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:3e85e224321851428be2d341c3d4ee0894ed483d8db83a0b50cc2abae2ff6244
-size 1168138808

 version https://git-lfs.github.com/spec/v1
+oid sha256:68b033e3fcfecf40639a530f7a6de46f152c9f463d1c5ec56bf25bde00cffb3f
+size 1050673280

model.safetensors.index.json CHANGED Viewed

@@ -1 +1 @@

- {"metadata": {"mergekit_version": "0.0.4.2", "total_size": 16060522496}, "weight_map": {"model.layers.8.mlp.down_proj.weight": "model-00001-of-00009.safetensors", "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00009.safetensors", "model.layers.8.mlp.up_proj.weight": "model-00001-of-00009.safetensors", "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00009.safetensors", "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00009.safetensors", "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00009.safetensors", "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00009.safetensors", "model.layers.8.input_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.7.mlp.down_proj.weight": "model-00001-of-00009.safetensors", "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00009.safetensors", "model.layers.7.mlp.up_proj.weight": "model-00001-of-00009.safetensors", "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00009.safetensors", "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00009.safetensors", "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00009.safetensors", "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00009.safetensors", "model.layers.7.input_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.6.mlp.down_proj.weight": "model-00001-of-00009.safetensors", "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00009.safetensors", "model.layers.6.mlp.up_proj.weight": "model-00001-of-00009.safetensors", "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00009.safetensors", "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00009.safetensors", "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00009.safetensors", "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00009.safetensors", "model.layers.6.input_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.5.mlp.down_proj.weight": "model-00001-of-00009.safetensors", "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00009.safetensors", "model.layers.5.mlp.up_proj.weight": "model-00001-of-00009.safetensors", "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00009.safetensors", "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00009.safetensors", "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00009.safetensors", "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00009.safetensors", "model.layers.5.input_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.4.mlp.down_proj.weight": "model-00001-of-00009.safetensors", "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00009.safetensors", "model.layers.4.mlp.up_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.4.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.input_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.3.mlp.down_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.mlp.up_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.3.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.input_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.2.mlp.down_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.mlp.up_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.2.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.input_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.1.mlp.down_proj.weight": "model-00002-of-00009.safetensors", "model.layers.1.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", "model.layers.1.mlp.up_proj.weight": "model-00002-of-00009.safetensors", "model.layers.1.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.1.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", "model.layers.1.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", "model.layers.1.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", "model.layers.1.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", "model.layers.1.input_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.0.mlp.down_proj.weight": "model-00002-of-00009.safetensors", "model.layers.0.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", "model.layers.0.mlp.up_proj.weight": "model-00002-of-00009.safetensors", "model.layers.0.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.0.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", "model.layers.0.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", "model.layers.0.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", "model.layers.0.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", "model.layers.0.input_layernorm.weight": "model-00002-of-00009.safetensors", "model.embed_tokens.weight": "model-00003-of-00009.safetensors", "model.layers.20.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", "model.layers.20.self_attn.o_proj.weight": "model-00003-of-00009.safetensors", "model.layers.20.self_attn.v_proj.weight": "model-00003-of-00009.safetensors", "model.layers.20.self_attn.k_proj.weight": "model-00003-of-00009.safetensors", "model.layers.20.self_attn.q_proj.weight": "model-00003-of-00009.safetensors", "model.layers.19.mlp.down_proj.weight": "model-00003-of-00009.safetensors", "model.layers.19.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", "model.layers.19.mlp.up_proj.weight": "model-00003-of-00009.safetensors", "model.layers.19.post_attention_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.19.self_attn.o_proj.weight": "model-00003-of-00009.safetensors", "model.layers.19.self_attn.v_proj.weight": "model-00003-of-00009.safetensors", "model.layers.19.self_attn.k_proj.weight": "model-00003-of-00009.safetensors", "model.layers.19.self_attn.q_proj.weight": "model-00003-of-00009.safetensors", "model.layers.19.input_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.18.mlp.down_proj.weight": "model-00003-of-00009.safetensors", "model.layers.18.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", "model.layers.18.mlp.up_proj.weight": "model-00004-of-00009.safetensors", "model.layers.18.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.18.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", "model.layers.18.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", "model.layers.18.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", "model.layers.18.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", "model.layers.18.input_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.17.mlp.down_proj.weight": "model-00004-of-00009.safetensors", "model.layers.17.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", "model.layers.17.mlp.up_proj.weight": "model-00004-of-00009.safetensors", "model.layers.17.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.17.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", "model.layers.17.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", "model.layers.17.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", "model.layers.17.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", "model.layers.17.input_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.16.mlp.down_proj.weight": "model-00004-of-00009.safetensors", "model.layers.16.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", "model.layers.16.mlp.up_proj.weight": "model-00004-of-00009.safetensors", "model.layers.16.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.16.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", "model.layers.16.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", "model.layers.16.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", "model.layers.16.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", "model.layers.16.input_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.15.mlp.down_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.mlp.up_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.15.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.input_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.14.mlp.down_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.mlp.up_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.14.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.input_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.13.mlp.down_proj.weight": "model-00005-of-00009.safetensors", "model.layers.13.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", "model.layers.13.mlp.up_proj.weight": "model-00005-of-00009.safetensors", "model.layers.13.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.13.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", "model.layers.13.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", "model.layers.13.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", "model.layers.13.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", "model.layers.13.input_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.12.mlp.down_proj.weight": "model-00005-of-00009.safetensors", "model.layers.12.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", "model.layers.12.mlp.up_proj.weight": "model-00005-of-00009.safetensors", "model.layers.12.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.12.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", "model.layers.12.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", "model.layers.12.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", "model.layers.12.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", "model.layers.12.input_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.11.mlp.down_proj.weight": "model-00005-of-00009.safetensors", "model.layers.11.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", "model.layers.11.mlp.up_proj.weight": "model-00005-of-00009.safetensors", "model.layers.11.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.11.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", "model.layers.11.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", "model.layers.11.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", "model.layers.11.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", "model.layers.11.input_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.10.mlp.down_proj.weight": "model-00005-of-00009.safetensors", "model.layers.10.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", "model.layers.10.mlp.up_proj.weight": "model-00005-of-00009.safetensors", "model.layers.10.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.10.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", "model.layers.10.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", "model.layers.10.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", "model.layers.10.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", "model.layers.10.input_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.9.mlp.down_proj.weight": "model-00005-of-00009.safetensors", "model.layers.9.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", "model.layers.9.mlp.up_proj.weight": "model-00006-of-00009.safetensors", "model.layers.9.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.9.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", "model.layers.9.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", "model.layers.9.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", "model.layers.9.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", "model.layers.9.input_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.31.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", "model.layers.31.mlp.up_proj.weight": "model-00006-of-00009.safetensors", "model.layers.31.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", "model.layers.31.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", "model.layers.31.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", "model.layers.31.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", "model.layers.30.mlp.down_proj.weight": "model-00006-of-00009.safetensors", "model.layers.30.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", "model.layers.30.mlp.up_proj.weight": "model-00006-of-00009.safetensors", "model.layers.30.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.30.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", "model.layers.30.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", "model.layers.30.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", "model.layers.30.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", "model.layers.30.input_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.29.mlp.down_proj.weight": "model-00006-of-00009.safetensors", "model.layers.29.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", "model.layers.29.mlp.up_proj.weight": "model-00006-of-00009.safetensors", "model.layers.29.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.29.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", "model.layers.29.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", "model.layers.29.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", "model.layers.29.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", "model.layers.29.input_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.28.mlp.down_proj.weight": "model-00006-of-00009.safetensors", "model.layers.28.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", "model.layers.28.mlp.up_proj.weight": "model-00006-of-00009.safetensors", "model.layers.28.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.28.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", "model.layers.28.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", "model.layers.28.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", "model.layers.28.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", "model.layers.28.input_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.27.mlp.down_proj.weight": "model-00006-of-00009.safetensors", "model.layers.27.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.mlp.up_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.27.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.input_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.26.mlp.down_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.mlp.up_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.26.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.input_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.25.mlp.down_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.mlp.up_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.25.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.input_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.24.mlp.down_proj.weight": "model-00007-of-00009.safetensors", "model.layers.24.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", "model.layers.24.mlp.up_proj.weight": "model-00007-of-00009.safetensors", "model.layers.24.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.24.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", "model.layers.24.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", "model.layers.24.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", "model.layers.24.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", "model.layers.24.input_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.23.mlp.down_proj.weight": "model-00007-of-00009.safetensors", "model.layers.23.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", "model.layers.23.mlp.up_proj.weight": "model-00007-of-00009.safetensors", "model.layers.23.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.23.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", "model.layers.23.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", "model.layers.23.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", "model.layers.23.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", "model.layers.23.input_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.22.mlp.down_proj.weight": "model-00008-of-00009.safetensors", "model.layers.22.mlp.gate_proj.weight": "model-00008-of-00009.safetensors", "model.layers.22.mlp.up_proj.weight": "model-00008-of-00009.safetensors", "model.layers.22.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.22.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", "model.layers.22.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", "model.layers.22.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", "model.layers.22.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", "model.layers.22.input_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.21.mlp.down_proj.weight": "model-00008-of-00009.safetensors", "model.layers.21.mlp.gate_proj.weight": "model-00008-of-00009.safetensors", "model.layers.21.mlp.up_proj.weight": "model-00008-of-00009.safetensors", "model.layers.21.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.21.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", "model.layers.21.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", "model.layers.21.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", "model.layers.21.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", "model.layers.21.input_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.20.mlp.down_proj.weight": "model-00008-of-00009.safetensors", "model.layers.20.mlp.up_proj.weight": "model-00008-of-00009.safetensors", "model.layers.20.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.20.input_layernorm.weight": "model-00008-of-00009.safetensors", "lm_head.weight": "model-00009-of-00009.safetensors", "model.norm.weight": "model-00009-of-00009.safetensors", "model.layers.31.mlp.down_proj.weight": "model-00009-of-00009.safetensors", "model.layers.31.post_attention_layernorm.weight": "model-00009-of-00009.safetensors", "model.layers.31.input_layernorm.weight": "model-00009-of-00009.safetensors"}}

+ {"metadata": {"mergekit_version": "0.0.4.2", "total_size": 16060522496}, "weight_map": {"model.layers.2.self_attn.v_proj.weight": "model-00001-of-00009.safetensors", "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00009.safetensors", "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00009.safetensors", "model.layers.1.mlp.down_proj.weight": "model-00001-of-00009.safetensors", "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00009.safetensors", "model.layers.1.mlp.up_proj.weight": "model-00001-of-00009.safetensors", "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00009.safetensors", "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00009.safetensors", "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00009.safetensors", "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00009.safetensors", "model.layers.1.input_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.0.mlp.down_proj.weight": "model-00001-of-00009.safetensors", "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00009.safetensors", "model.layers.0.mlp.up_proj.weight": "model-00001-of-00009.safetensors", "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00009.safetensors", "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00009.safetensors", "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00009.safetensors", "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00009.safetensors", "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00009.safetensors", "model.layers.0.input_layernorm.weight": "model-00001-of-00009.safetensors", "model.embed_tokens.weight": "model-00001-of-00009.safetensors", "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", "model.layers.6.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", "model.layers.6.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", "model.layers.6.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", "model.layers.5.mlp.down_proj.weight": "model-00002-of-00009.safetensors", "model.layers.5.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", "model.layers.5.mlp.up_proj.weight": "model-00002-of-00009.safetensors", "model.layers.5.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.5.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", "model.layers.5.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", "model.layers.5.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", "model.layers.5.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", "model.layers.5.input_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.4.mlp.down_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.mlp.up_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.4.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", "model.layers.4.input_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.3.mlp.down_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.mlp.up_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.3.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.self_attn.v_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.self_attn.k_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.self_attn.q_proj.weight": "model-00002-of-00009.safetensors", "model.layers.3.input_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.2.mlp.down_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.mlp.gate_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.mlp.up_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.post_attention_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.2.self_attn.o_proj.weight": "model-00002-of-00009.safetensors", "model.layers.2.input_layernorm.weight": "model-00002-of-00009.safetensors", "model.layers.10.mlp.down_proj.weight": "model-00003-of-00009.safetensors", "model.layers.10.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", "model.layers.10.mlp.up_proj.weight": "model-00003-of-00009.safetensors", "model.layers.10.post_attention_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.10.self_attn.o_proj.weight": "model-00003-of-00009.safetensors", "model.layers.10.self_attn.v_proj.weight": "model-00003-of-00009.safetensors", "model.layers.10.self_attn.k_proj.weight": "model-00003-of-00009.safetensors", "model.layers.10.self_attn.q_proj.weight": "model-00003-of-00009.safetensors", "model.layers.10.input_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.9.mlp.down_proj.weight": "model-00003-of-00009.safetensors", "model.layers.9.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", "model.layers.9.mlp.up_proj.weight": "model-00003-of-00009.safetensors", "model.layers.9.post_attention_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.9.self_attn.o_proj.weight": "model-00003-of-00009.safetensors", "model.layers.9.self_attn.v_proj.weight": "model-00003-of-00009.safetensors", "model.layers.9.self_attn.k_proj.weight": "model-00003-of-00009.safetensors", "model.layers.9.self_attn.q_proj.weight": "model-00003-of-00009.safetensors", "model.layers.9.input_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.8.mlp.down_proj.weight": "model-00003-of-00009.safetensors", "model.layers.8.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", "model.layers.8.mlp.up_proj.weight": "model-00003-of-00009.safetensors", "model.layers.8.post_attention_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.8.self_attn.o_proj.weight": "model-00003-of-00009.safetensors", "model.layers.8.self_attn.v_proj.weight": "model-00003-of-00009.safetensors", "model.layers.8.self_attn.k_proj.weight": "model-00003-of-00009.safetensors", "model.layers.8.self_attn.q_proj.weight": "model-00003-of-00009.safetensors", "model.layers.8.input_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.7.mlp.down_proj.weight": "model-00003-of-00009.safetensors", "model.layers.7.mlp.gate_proj.weight": "model-00003-of-00009.safetensors", "model.layers.7.mlp.up_proj.weight": "model-00003-of-00009.safetensors", "model.layers.7.post_attention_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.7.self_attn.o_proj.weight": "model-00003-of-00009.safetensors", "model.layers.7.self_attn.v_proj.weight": "model-00003-of-00009.safetensors", "model.layers.7.self_attn.k_proj.weight": "model-00003-of-00009.safetensors", "model.layers.7.self_attn.q_proj.weight": "model-00003-of-00009.safetensors", "model.layers.7.input_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.6.mlp.down_proj.weight": "model-00003-of-00009.safetensors", "model.layers.6.mlp.up_proj.weight": "model-00003-of-00009.safetensors", "model.layers.6.post_attention_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.6.input_layernorm.weight": "model-00003-of-00009.safetensors", "model.layers.15.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", "model.layers.15.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.mlp.down_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.mlp.up_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.14.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", "model.layers.14.input_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.13.mlp.down_proj.weight": "model-00004-of-00009.safetensors", "model.layers.13.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", "model.layers.13.mlp.up_proj.weight": "model-00004-of-00009.safetensors", "model.layers.13.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.13.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", "model.layers.13.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", "model.layers.13.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", "model.layers.13.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", "model.layers.13.input_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.12.mlp.down_proj.weight": "model-00004-of-00009.safetensors", "model.layers.12.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", "model.layers.12.mlp.up_proj.weight": "model-00004-of-00009.safetensors", "model.layers.12.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.12.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", "model.layers.12.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", "model.layers.12.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", "model.layers.12.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", "model.layers.12.input_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.11.mlp.down_proj.weight": "model-00004-of-00009.safetensors", "model.layers.11.mlp.gate_proj.weight": "model-00004-of-00009.safetensors", "model.layers.11.mlp.up_proj.weight": "model-00004-of-00009.safetensors", "model.layers.11.post_attention_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.11.self_attn.o_proj.weight": "model-00004-of-00009.safetensors", "model.layers.11.self_attn.v_proj.weight": "model-00004-of-00009.safetensors", "model.layers.11.self_attn.k_proj.weight": "model-00004-of-00009.safetensors", "model.layers.11.self_attn.q_proj.weight": "model-00004-of-00009.safetensors", "model.layers.11.input_layernorm.weight": "model-00004-of-00009.safetensors", "model.layers.19.mlp.down_proj.weight": "model-00005-of-00009.safetensors", "model.layers.19.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", "model.layers.19.mlp.up_proj.weight": "model-00005-of-00009.safetensors", "model.layers.19.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.19.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", "model.layers.19.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", "model.layers.19.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", "model.layers.19.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", "model.layers.19.input_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.18.mlp.down_proj.weight": "model-00005-of-00009.safetensors", "model.layers.18.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", "model.layers.18.mlp.up_proj.weight": "model-00005-of-00009.safetensors", "model.layers.18.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.18.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", "model.layers.18.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", "model.layers.18.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", "model.layers.18.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", "model.layers.18.input_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.17.mlp.down_proj.weight": "model-00005-of-00009.safetensors", "model.layers.17.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", "model.layers.17.mlp.up_proj.weight": "model-00005-of-00009.safetensors", "model.layers.17.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.17.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", "model.layers.17.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", "model.layers.17.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", "model.layers.17.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", "model.layers.17.input_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.16.mlp.down_proj.weight": "model-00005-of-00009.safetensors", "model.layers.16.mlp.gate_proj.weight": "model-00005-of-00009.safetensors", "model.layers.16.mlp.up_proj.weight": "model-00005-of-00009.safetensors", "model.layers.16.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.16.self_attn.o_proj.weight": "model-00005-of-00009.safetensors", "model.layers.16.self_attn.v_proj.weight": "model-00005-of-00009.safetensors", "model.layers.16.self_attn.k_proj.weight": "model-00005-of-00009.safetensors", "model.layers.16.self_attn.q_proj.weight": "model-00005-of-00009.safetensors", "model.layers.16.input_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.15.mlp.down_proj.weight": "model-00005-of-00009.safetensors", "model.layers.15.mlp.up_proj.weight": "model-00005-of-00009.safetensors", "model.layers.15.post_attention_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.15.input_layernorm.weight": "model-00005-of-00009.safetensors", "model.layers.24.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", "model.layers.24.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", "model.layers.24.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", "model.layers.24.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", "model.layers.24.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", "model.layers.23.mlp.down_proj.weight": "model-00006-of-00009.safetensors", "model.layers.23.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", "model.layers.23.mlp.up_proj.weight": "model-00006-of-00009.safetensors", "model.layers.23.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.23.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", "model.layers.23.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", "model.layers.23.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", "model.layers.23.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", "model.layers.23.input_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.22.mlp.down_proj.weight": "model-00006-of-00009.safetensors", "model.layers.22.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", "model.layers.22.mlp.up_proj.weight": "model-00006-of-00009.safetensors", "model.layers.22.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.22.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", "model.layers.22.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", "model.layers.22.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", "model.layers.22.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", "model.layers.22.input_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.21.mlp.down_proj.weight": "model-00006-of-00009.safetensors", "model.layers.21.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", "model.layers.21.mlp.up_proj.weight": "model-00006-of-00009.safetensors", "model.layers.21.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.21.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", "model.layers.21.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", "model.layers.21.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", "model.layers.21.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", "model.layers.21.input_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.20.mlp.down_proj.weight": "model-00006-of-00009.safetensors", "model.layers.20.mlp.gate_proj.weight": "model-00006-of-00009.safetensors", "model.layers.20.mlp.up_proj.weight": "model-00006-of-00009.safetensors", "model.layers.20.post_attention_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.20.self_attn.o_proj.weight": "model-00006-of-00009.safetensors", "model.layers.20.self_attn.v_proj.weight": "model-00006-of-00009.safetensors", "model.layers.20.self_attn.k_proj.weight": "model-00006-of-00009.safetensors", "model.layers.20.self_attn.q_proj.weight": "model-00006-of-00009.safetensors", "model.layers.20.input_layernorm.weight": "model-00006-of-00009.safetensors", "model.layers.28.mlp.down_proj.weight": "model-00007-of-00009.safetensors", "model.layers.28.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", "model.layers.28.mlp.up_proj.weight": "model-00007-of-00009.safetensors", "model.layers.28.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.28.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", "model.layers.28.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", "model.layers.28.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", "model.layers.28.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", "model.layers.28.input_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.27.mlp.down_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.mlp.up_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.27.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", "model.layers.27.input_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.26.mlp.down_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.mlp.up_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.26.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", "model.layers.26.input_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.25.mlp.down_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.mlp.gate_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.mlp.up_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.25.self_attn.o_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.self_attn.v_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.self_attn.k_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.self_attn.q_proj.weight": "model-00007-of-00009.safetensors", "model.layers.25.input_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.24.mlp.down_proj.weight": "model-00007-of-00009.safetensors", "model.layers.24.mlp.up_proj.weight": "model-00007-of-00009.safetensors", "model.layers.24.post_attention_layernorm.weight": "model-00007-of-00009.safetensors", "model.layers.24.input_layernorm.weight": "model-00007-of-00009.safetensors", "model.norm.weight": "model-00007-of-00009.safetensors", "model.layers.31.mlp.down_proj.weight": "model-00008-of-00009.safetensors", "model.layers.31.mlp.gate_proj.weight": "model-00008-of-00009.safetensors", "model.layers.31.mlp.up_proj.weight": "model-00008-of-00009.safetensors", "model.layers.31.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.31.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", "model.layers.31.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", "model.layers.31.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", "model.layers.31.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", "model.layers.31.input_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.30.mlp.down_proj.weight": "model-00008-of-00009.safetensors", "model.layers.30.mlp.gate_proj.weight": "model-00008-of-00009.safetensors", "model.layers.30.mlp.up_proj.weight": "model-00008-of-00009.safetensors", "model.layers.30.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.30.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", "model.layers.30.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", "model.layers.30.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", "model.layers.30.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", "model.layers.30.input_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.29.mlp.down_proj.weight": "model-00008-of-00009.safetensors", "model.layers.29.mlp.gate_proj.weight": "model-00008-of-00009.safetensors", "model.layers.29.mlp.up_proj.weight": "model-00008-of-00009.safetensors", "model.layers.29.post_attention_layernorm.weight": "model-00008-of-00009.safetensors", "model.layers.29.self_attn.o_proj.weight": "model-00008-of-00009.safetensors", "model.layers.29.self_attn.v_proj.weight": "model-00008-of-00009.safetensors", "model.layers.29.self_attn.k_proj.weight": "model-00008-of-00009.safetensors", "model.layers.29.self_attn.q_proj.weight": "model-00008-of-00009.safetensors", "model.layers.29.input_layernorm.weight": "model-00008-of-00009.safetensors", "lm_head.weight": "model-00009-of-00009.safetensors"}}

special_tokens_map.json CHANGED Viewed

@@ -1,24 +1,20 @@
 {
-  "additional_special_tokens": [
-    "<|im_start|>",
-    "<|im_end|>"
-  ],
   "bos_token": {
-    "content": "<|im_start|>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,
     "single_word": false
   },
   "eos_token": {
-    "content": "<|im_end|>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,
     "single_word": false
   },
   "pad_token": {
-    "content": "<|im_end|>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,

 {
   "bos_token": {
+    "content": "<|begin_of_text|>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,
     "single_word": false
   },
   "eos_token": {
+    "content": "<|end_of_text|>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,
     "single_word": false
   },
   "pad_token": {
+    "content": "<|end_of_text|>",
     "lstrip": false,
     "normalized": false,
     "rstrip": false,

tokenizer.json CHANGED Viewed

@@ -1,7 +1,21 @@
 {
   "version": "1.0",
-  "truncation": null,
-  "padding": null,
   "added_tokens": [
     {
       "id": 128000,
@@ -2306,24 +2320,6 @@
       "rstrip": false,
       "normalized": false,
       "special": true
-    },
-    {
-      "id": 128256,
-      "content": "<|im_start|>",
-      "single_word": false,
-      "lstrip": false,
-      "rstrip": false,
-      "normalized": false,
-      "special": true
-    },
-    {
-      "id": 128257,
-      "content": "<|im_end|>",
-      "single_word": false,
-      "lstrip": false,
-      "rstrip": false,
-      "normalized": false,
-      "special": true
     }
   ],
   "normalizer": null,

 {
   "version": "1.0",
+  "truncation": {
+    "direction": "Right",
+    "max_length": 512,
+    "strategy": "LongestFirst",
+    "stride": 0
+  },
+  "padding": {
+    "strategy": {
+      "Fixed": 512
+    },
+    "direction": "Right",
+    "pad_to_multiple_of": null,
+    "pad_id": 128001,
+    "pad_type_id": 0,
+    "pad_token": "<|end_of_text|>"
+  },
   "added_tokens": [
     {
       "id": 128000,
       "rstrip": false,
       "normalized": false,
       "special": true
     }
   ],
   "normalizer": null,

tokenizer_config.json CHANGED Viewed

@@ -2047,37 +2047,24 @@
       "rstrip": false,
       "single_word": false,
       "special": true
-    },
-    "128256": {
-      "content": "<|im_start|>",
-      "lstrip": false,
-      "normalized": false,
-      "rstrip": false,
-      "single_word": false,
-      "special": true
-    },
-    "128257": {
-      "content": "<|im_end|>",
-      "lstrip": false,
-      "normalized": false,
-      "rstrip": false,
-      "single_word": false,
-      "special": true
     }
   },
-  "additional_special_tokens": [
-    "<|im_start|>",
-    "<|im_end|>"
-  ],
-  "bos_token": "<|im_start|>",
-  "chat_template": "{% for message in messages %}{{'<|im_start|>' + message['role'] + '\n' + message['content'] + '<|im_end|>' + '\n'}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant\n' }}{% endif %}",
   "clean_up_tokenization_spaces": true,
-  "eos_token": "<|im_end|>",
   "model_input_names": [
     "input_ids",
     "attention_mask"
   ],
   "model_max_length": 1000000000000000019884624838656,
-  "pad_token": "<|im_end|>",
-  "tokenizer_class": "PreTrainedTokenizerFast"
 }

       "rstrip": false,
       "single_word": false,
       "special": true
     }
   },
+  "bos_token": "<|begin_of_text|>",
+  "chat_template": "{%- set ns = namespace(found=false) -%}{%- for message in messages -%}{%- if message['role'] == 'system' -%}{%- set ns.found = true -%}{%- endif -%}{%- endfor -%}{%- for message in messages %}{%- if message['role'] == 'system' -%}{{- '<|im_start|>system\n' + message['content'].rstrip() + '<|im_end|>\n' -}}{%- else -%}{%- if message['role'] == 'user' -%}{{-'<|im_start|>user\n' + message['content'].rstrip() + '<|im_end|>\n'-}}{%- else -%}{{-'<|im_start|>assistant\n' + message['content'] + '<|im_end|>\n' -}}{%- endif -%}{%- endif -%}{%- endfor -%}{%- if add_generation_prompt -%}{{-'<|im_start|>assistant\n'-}}{%- endif -%}",
   "clean_up_tokenization_spaces": true,
+  "eos_token": "<|end_of_text|>",
+  "max_length": 512,
   "model_input_names": [
     "input_ids",
     "attention_mask"
   ],
   "model_max_length": 1000000000000000019884624838656,
+  "pad_to_multiple_of": null,
+  "pad_token": "<|end_of_text|>",
+  "pad_token_type_id": 0,
+  "padding_side": "right",
+  "stride": 0,
+  "tokenizer_class": "PreTrainedTokenizerFast",
+  "truncation_side": "right",
+  "truncation_strategy": "longest_first"
 }