Xenova
/

xlm-fast-tokenizer

Xenova HF staff commited on Sep 7, 2023

Commit

0dd4e75

•

1 Parent(s): b66bf92

Upload 2 files

Files changed (2) hide show

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

+{
+  "additional_special_tokens": [
+    "<special0>",
+    "<special1>",
+    "<special2>",
+    "<special3>",
+    "<special4>",
+    "<special5>",
+    "<special6>",
+    "<special7>",
+    "<special8>",
+    "<special9>"
+  ],
+  "bos_token": "<s>",
+  "clean_up_tokenization_spaces": true,
+  "cls_token": "</s>",
+  "do_lowercase_and_remove_accent": true,
+  "id2lang": {
+    "0": "de",
+    "1": "en"
+  },
+  "lang2id": {
+    "de": 0,
+    "en": 1
+  },
+  "mask_token": "<special1>",
+  "model_max_length": 512,
+  "pad_token": "<pad>",
+  "sep_token": "</s>",
+  "tokenizer_class": "XLMTokenizer",
+  "unk_token": "<unk>"
+}