LoneStriker commited on Dec 11, 2023

Commit

d62785a

•

1 Parent(s): c7469db

Upload folder using huggingface_hub

Browse files

Files changed (22) hide show

config.json +29 -0
generation_config.json +6 -0
pytorch_model-00001-of-00019.bin +3 -0
pytorch_model-00002-of-00019.bin +3 -0
pytorch_model-00003-of-00019.bin +3 -0
pytorch_model-00004-of-00019.bin +3 -0
pytorch_model-00005-of-00019.bin +3 -0
pytorch_model-00006-of-00019.bin +3 -0
pytorch_model-00007-of-00019.bin +3 -0
pytorch_model-00008-of-00019.bin +3 -0
pytorch_model-00009-of-00019.bin +3 -0
pytorch_model-00010-of-00019.bin +3 -0
pytorch_model-00011-of-00019.bin +3 -0
pytorch_model-00012-of-00019.bin +3 -0
pytorch_model-00013-of-00019.bin +3 -0
pytorch_model-00014-of-00019.bin +3 -0
pytorch_model-00015-of-00019.bin +3 -0
pytorch_model-00016-of-00019.bin +3 -0
pytorch_model-00017-of-00019.bin +3 -0
pytorch_model-00018-of-00019.bin +3 -0
pytorch_model-00019-of-00019.bin +3 -0
pytorch_model.bin.index.json +1002 -0

config.json ADDED Viewed

	@@ -0,0 +1,29 @@

+{
+  "architectures": [
+    "MixtralForCausalLM"
+  ],
+  "attention_dropout": 0.0,
+  "bos_token_id": 1,
+  "eos_token_id": 2,
+  "hidden_act": "silu",
+  "hidden_size": 4096,
+  "initializer_range": 0.02,
+  "intermediate_size": 14336,
+  "max_position_embeddings": 32768,
+  "model_type": "mixtral",
+  "num_attention_heads": 32,
+  "num_experts_per_tok": 2,
+  "num_hidden_layers": 32,
+  "num_key_value_heads": 8,
+  "num_local_experts": 8,
+  "output_router_logits": false,
+  "rms_norm_eps": 1e-05,
+  "rope_theta": 1000000.0,
+  "router_aux_loss_coef": 0.001,
+  "sliding_window": 4096,
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.36.0.dev0",
+  "use_cache": true,
+  "vocab_size": 32000
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,6 @@

+{
+  "_from_model_config": true,
+  "bos_token_id": 1,
+  "eos_token_id": 2,
+  "transformers_version": "4.36.0.dev0"
+}

pytorch_model-00001-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:9e6b573d442d5947aef90e99afb525f10da4f6182da7c65a76ab1c5038c3b561
+size 4892821288

pytorch_model-00002-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2ddc73bc4e46da86010aedb5286da10a3f458190782065e7b4c8c377ed56a62e
+size 4983016612

pytorch_model-00003-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c18f0916dfd08e8c05ebb0704c8138ab6f3672c8607982c87df89d27cf904b86
+size 4983016696

pytorch_model-00004-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5535e742bbe58187c660df40ed47787e0e2ae9081c6df6b5f163fe18f9ebac55
+size 4899046246

pytorch_model-00005-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:0805a3415c8e2ae8529b25cb8a9349f26d7d0d218af7e7b7c9247b49092dd920
+size 4983016648

pytorch_model-00006-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:89574843dfcd74502b678ca2df481f80971ad2a114b25cddda4b7bfe926963c0
+size 4983016612

pytorch_model-00007-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e6b480d939e5c062a54e1a8b0c1f5d8eb54d14566237d4590e17a04b13f81651
+size 4899046246

pytorch_model-00008-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:dd7c902bcac6031c3ac1a5fb0697c0cb63c5b5484a578588efaccb90f5a1c0c2
+size 4983016736

pytorch_model-00009-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:618b30350cfd0988833e24adffcd235cd802d8087cc248ce6fb20e811a8b5315
+size 4983016676

pytorch_model-00010-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:237db1819465073bb9434260fb4cb279e00a3319ac97b97687d787ae8c3612f6
+size 4899046246

pytorch_model-00011-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b7234228bc9ebd8e06db266c8aca98edc74973e49bbb06c2da31569a9b834381
+size 4983016700

pytorch_model-00012-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4c9596da237257fdecf9f6ebe8fb9e0809c8c16bcb177b4f5e9082532847534b
+size 4983016700

pytorch_model-00013-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f558357131bac863415bc527215bb6ee22238bf8e986601225d95d52aecc70a1
+size 4983016676

pytorch_model-00014-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3a6451d1cf75b6f04577f7832c4b8b83744cf02273c1547f272e2949af590705
+size 4899046246

pytorch_model-00015-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:ab2fb5c21d8f23f2830fc8abcfa5e568f9f8bedbeea731245310ef7a6a24ce37
+size 4983016736

pytorch_model-00016-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:93bd77268a47379a7b143ca915be8c9c1fa0018a0bde076cf342da2df384d706
+size 4983016676

pytorch_model-00017-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f4141abed9140899ff2130cb0cbdfb30444a4a89c297d71f607c790758978ee5
+size 4899046246

pytorch_model-00018-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:19e217788dceed515049b378f1da7f2d0e1e3eb41c67cb816fba1a7be0ec6c3d
+size 4983016712

pytorch_model-00019-of-00019.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:20bb6f5c1770613bf31e4be888583ac7f0b01e3b3939c669a0f9a6c2594f53a2
+size 4221689154

pytorch_model.bin.index.json ADDED Viewed

	@@ -0,0 +1,1002 @@

+{
+  "metadata": {
+    "total_size": 93405585408
+  },
+  "weight_map": {
+    "lm_head.weight": "pytorch_model-00019-of-00019.bin",
+    "model.embed_tokens.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.block_sparse_moe.gate.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.input_layernorm.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.post_attention_layernorm.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.self_attn.k_proj.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.self_attn.o_proj.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.self_attn.q_proj.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.0.self_attn.v_proj.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.block_sparse_moe.gate.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.input_layernorm.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.post_attention_layernorm.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.1.self_attn.k_proj.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.self_attn.o_proj.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.self_attn.q_proj.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.1.self_attn.v_proj.weight": "pytorch_model-00001-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.block_sparse_moe.gate.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.10.input_layernorm.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.post_attention_layernorm.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.10.self_attn.k_proj.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.10.self_attn.o_proj.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.10.self_attn.q_proj.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.10.self_attn.v_proj.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.11.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.11.block_sparse_moe.gate.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.input_layernorm.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.11.post_attention_layernorm.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.11.self_attn.k_proj.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.self_attn.o_proj.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.self_attn.q_proj.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.11.self_attn.v_proj.weight": "pytorch_model-00007-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.block_sparse_moe.gate.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.input_layernorm.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.post_attention_layernorm.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.self_attn.k_proj.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.self_attn.o_proj.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.self_attn.q_proj.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.12.self_attn.v_proj.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.block_sparse_moe.gate.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.input_layernorm.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.post_attention_layernorm.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.13.self_attn.k_proj.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.self_attn.o_proj.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.self_attn.q_proj.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.13.self_attn.v_proj.weight": "pytorch_model-00008-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.block_sparse_moe.gate.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.input_layernorm.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.post_attention_layernorm.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.self_attn.k_proj.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.self_attn.o_proj.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.self_attn.q_proj.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.14.self_attn.v_proj.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.block_sparse_moe.gate.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.input_layernorm.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.post_attention_layernorm.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.15.self_attn.k_proj.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.self_attn.o_proj.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.self_attn.q_proj.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.15.self_attn.v_proj.weight": "pytorch_model-00009-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.16.block_sparse_moe.gate.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.input_layernorm.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.16.post_attention_layernorm.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.16.self_attn.k_proj.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.self_attn.o_proj.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.self_attn.q_proj.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.16.self_attn.v_proj.weight": "pytorch_model-00010-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.block_sparse_moe.gate.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.input_layernorm.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.post_attention_layernorm.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.self_attn.k_proj.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.self_attn.o_proj.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.self_attn.q_proj.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.17.self_attn.v_proj.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.18.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.18.block_sparse_moe.gate.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.input_layernorm.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.18.post_attention_layernorm.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.18.self_attn.k_proj.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.self_attn.o_proj.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.self_attn.q_proj.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.18.self_attn.v_proj.weight": "pytorch_model-00011-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.block_sparse_moe.gate.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.input_layernorm.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.post_attention_layernorm.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.self_attn.k_proj.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.self_attn.o_proj.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.self_attn.q_proj.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.19.self_attn.v_proj.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.block_sparse_moe.gate.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.input_layernorm.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.post_attention_layernorm.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.self_attn.k_proj.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.self_attn.o_proj.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.self_attn.q_proj.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.2.self_attn.v_proj.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.block_sparse_moe.gate.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.input_layernorm.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.post_attention_layernorm.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.20.self_attn.k_proj.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.self_attn.o_proj.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.self_attn.q_proj.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.20.self_attn.v_proj.weight": "pytorch_model-00012-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.block_sparse_moe.gate.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.input_layernorm.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.post_attention_layernorm.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.self_attn.k_proj.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.self_attn.o_proj.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.self_attn.q_proj.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.21.self_attn.v_proj.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.block_sparse_moe.gate.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.22.input_layernorm.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.post_attention_layernorm.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.22.self_attn.k_proj.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.22.self_attn.o_proj.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.22.self_attn.q_proj.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.22.self_attn.v_proj.weight": "pytorch_model-00013-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.23.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.23.block_sparse_moe.gate.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.input_layernorm.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.23.post_attention_layernorm.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.23.self_attn.k_proj.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.self_attn.o_proj.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.self_attn.q_proj.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.23.self_attn.v_proj.weight": "pytorch_model-00014-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.block_sparse_moe.gate.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.input_layernorm.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.post_attention_layernorm.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.self_attn.k_proj.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.self_attn.o_proj.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.self_attn.q_proj.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.24.self_attn.v_proj.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.block_sparse_moe.gate.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.input_layernorm.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.post_attention_layernorm.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.25.self_attn.k_proj.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.self_attn.o_proj.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.self_attn.q_proj.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.25.self_attn.v_proj.weight": "pytorch_model-00015-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.block_sparse_moe.gate.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.input_layernorm.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.post_attention_layernorm.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.self_attn.k_proj.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.self_attn.o_proj.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.self_attn.q_proj.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.26.self_attn.v_proj.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.block_sparse_moe.gate.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.27.input_layernorm.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.post_attention_layernorm.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.27.self_attn.k_proj.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.27.self_attn.o_proj.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.27.self_attn.q_proj.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.27.self_attn.v_proj.weight": "pytorch_model-00016-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.28.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.28.block_sparse_moe.gate.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.input_layernorm.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.28.post_attention_layernorm.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.28.self_attn.k_proj.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.self_attn.o_proj.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.self_attn.q_proj.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.28.self_attn.v_proj.weight": "pytorch_model-00017-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.block_sparse_moe.gate.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.input_layernorm.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.post_attention_layernorm.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.self_attn.k_proj.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.self_attn.o_proj.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.self_attn.q_proj.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.29.self_attn.v_proj.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.block_sparse_moe.gate.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.input_layernorm.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.post_attention_layernorm.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.3.self_attn.k_proj.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.self_attn.o_proj.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.self_attn.q_proj.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.3.self_attn.v_proj.weight": "pytorch_model-00002-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.block_sparse_moe.gate.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.input_layernorm.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.post_attention_layernorm.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.30.self_attn.k_proj.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.self_attn.o_proj.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.self_attn.q_proj.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.30.self_attn.v_proj.weight": "pytorch_model-00018-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.block_sparse_moe.gate.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.input_layernorm.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.post_attention_layernorm.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.self_attn.k_proj.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.self_attn.o_proj.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.self_attn.q_proj.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.31.self_attn.v_proj.weight": "pytorch_model-00019-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.block_sparse_moe.gate.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.input_layernorm.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.post_attention_layernorm.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.self_attn.k_proj.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.self_attn.o_proj.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.self_attn.q_proj.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.4.self_attn.v_proj.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.block_sparse_moe.gate.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.5.input_layernorm.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.post_attention_layernorm.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.5.self_attn.k_proj.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.5.self_attn.o_proj.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.5.self_attn.q_proj.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.5.self_attn.v_proj.weight": "pytorch_model-00003-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.6.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.6.block_sparse_moe.gate.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.input_layernorm.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.6.post_attention_layernorm.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.6.self_attn.k_proj.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.self_attn.o_proj.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.self_attn.q_proj.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.6.self_attn.v_proj.weight": "pytorch_model-00004-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.block_sparse_moe.gate.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.input_layernorm.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.post_attention_layernorm.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.self_attn.k_proj.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.self_attn.o_proj.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.self_attn.q_proj.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.7.self_attn.v_proj.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.block_sparse_moe.gate.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.input_layernorm.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.post_attention_layernorm.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.8.self_attn.k_proj.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.self_attn.o_proj.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.self_attn.q_proj.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.8.self_attn.v_proj.weight": "pytorch_model-00005-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.0.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.0.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.0.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.1.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.1.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.1.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.2.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.2.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.2.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.3.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.3.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.3.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.4.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.4.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.4.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.5.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.5.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.5.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.6.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.6.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.6.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.7.w1.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.7.w2.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.experts.7.w3.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.block_sparse_moe.gate.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.input_layernorm.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.post_attention_layernorm.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.self_attn.k_proj.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.self_attn.o_proj.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.self_attn.q_proj.weight": "pytorch_model-00006-of-00019.bin",
+    "model.layers.9.self_attn.v_proj.weight": "pytorch_model-00006-of-00019.bin",
+    "model.norm.weight": "pytorch_model-00019-of-00019.bin"
+  }
+}