Add missing merge to tokenizer

#36

by sanchit-gandhi - opened Feb 29, 2024

←

Files changed (4) hide show

merges.txt CHANGED Viewed

@@ -1,4 +1,5 @@
 #version: 0.2
 Ġ a
 Ġt h
 i n

 #version: 0.2
+Ġ t
 Ġ a
 Ġt h
 i n

special_tokens_map.json CHANGED Viewed

@@ -111,22 +111,28 @@
   "bos_token": {
     "content": "<|endoftext|>",
     "lstrip": false,
-    "normalized": true,
     "rstrip": false,
     "single_word": false
   },
   "eos_token": {
     "content": "<|endoftext|>",
     "lstrip": false,
-    "normalized": true,
     "rstrip": false,
     "single_word": false
   },
-  "pad_token": "<|endoftext|>",
   "unk_token": {
     "content": "<|endoftext|>",
     "lstrip": false,
-    "normalized": true,
     "rstrip": false,
     "single_word": false
   }

   "bos_token": {
     "content": "<|endoftext|>",
     "lstrip": false,
+    "normalized": false,
     "rstrip": false,
     "single_word": false
   },
   "eos_token": {
     "content": "<|endoftext|>",
     "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
     "rstrip": false,
     "single_word": false
   },
   "unk_token": {
     "content": "<|endoftext|>",
     "lstrip": false,
+    "normalized": false,
     "rstrip": false,
     "single_word": false
   }

tokenizer.json CHANGED Viewed

@@ -64848,6 +64848,7 @@
       "<|endoftext|>": 50257
     },
     "merges": [
       "Ġ a",
       "Ġt h",
       "i n",

       "<|endoftext|>": 50257
     },
     "merges": [
+      "Ġ t",
       "Ġ a",
       "Ġt h",
       "i n",

tokenizer_config.json CHANGED Viewed

The diff for this file is too large to render. See raw diff