FIX special token tokenization errors in MT5 tokenizer

#10
Files changed (2) hide show
  1. special_tokens_map.json +103 -1
  2. tokenizer_config.json +104 -1
special_tokens_map.json CHANGED
@@ -1 +1,103 @@
1
- {"eos_token": "</s>", "unk_token": "<unk>", "pad_token": "<pad>", "additional_special_tokens": []}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"eos_token": "</s>", "unk_token": "<unk>", "pad_token": "<pad>",
2
+ "additional_special_tokens": ["<extra_id_0>",
3
+ "<extra_id_1>",
4
+ "<extra_id_2>",
5
+ "<extra_id_3>",
6
+ "<extra_id_4>",
7
+ "<extra_id_5>",
8
+ "<extra_id_6>",
9
+ "<extra_id_7>",
10
+ "<extra_id_8>",
11
+ "<extra_id_9>",
12
+ "<extra_id_10>",
13
+ "<extra_id_11>",
14
+ "<extra_id_12>",
15
+ "<extra_id_13>",
16
+ "<extra_id_14>",
17
+ "<extra_id_15>",
18
+ "<extra_id_16>",
19
+ "<extra_id_17>",
20
+ "<extra_id_18>",
21
+ "<extra_id_19>",
22
+ "<extra_id_20>",
23
+ "<extra_id_21>",
24
+ "<extra_id_22>",
25
+ "<extra_id_23>",
26
+ "<extra_id_24>",
27
+ "<extra_id_25>",
28
+ "<extra_id_26>",
29
+ "<extra_id_27>",
30
+ "<extra_id_28>",
31
+ "<extra_id_29>",
32
+ "<extra_id_30>",
33
+ "<extra_id_31>",
34
+ "<extra_id_32>",
35
+ "<extra_id_33>",
36
+ "<extra_id_34>",
37
+ "<extra_id_35>",
38
+ "<extra_id_36>",
39
+ "<extra_id_37>",
40
+ "<extra_id_38>",
41
+ "<extra_id_39>",
42
+ "<extra_id_40>",
43
+ "<extra_id_41>",
44
+ "<extra_id_42>",
45
+ "<extra_id_43>",
46
+ "<extra_id_44>",
47
+ "<extra_id_45>",
48
+ "<extra_id_46>",
49
+ "<extra_id_47>",
50
+ "<extra_id_48>",
51
+ "<extra_id_49>",
52
+ "<extra_id_50>",
53
+ "<extra_id_51>",
54
+ "<extra_id_52>",
55
+ "<extra_id_53>",
56
+ "<extra_id_54>",
57
+ "<extra_id_55>",
58
+ "<extra_id_56>",
59
+ "<extra_id_57>",
60
+ "<extra_id_58>",
61
+ "<extra_id_59>",
62
+ "<extra_id_60>",
63
+ "<extra_id_61>",
64
+ "<extra_id_62>",
65
+ "<extra_id_63>",
66
+ "<extra_id_64>",
67
+ "<extra_id_65>",
68
+ "<extra_id_66>",
69
+ "<extra_id_67>",
70
+ "<extra_id_68>",
71
+ "<extra_id_69>",
72
+ "<extra_id_70>",
73
+ "<extra_id_71>",
74
+ "<extra_id_72>",
75
+ "<extra_id_73>",
76
+ "<extra_id_74>",
77
+ "<extra_id_75>",
78
+ "<extra_id_76>",
79
+ "<extra_id_77>",
80
+ "<extra_id_78>",
81
+ "<extra_id_79>",
82
+ "<extra_id_80>",
83
+ "<extra_id_81>",
84
+ "<extra_id_82>",
85
+ "<extra_id_83>",
86
+ "<extra_id_84>",
87
+ "<extra_id_85>",
88
+ "<extra_id_86>",
89
+ "<extra_id_87>",
90
+ "<extra_id_88>",
91
+ "<extra_id_89>",
92
+ "<extra_id_90>",
93
+ "<extra_id_91>",
94
+ "<extra_id_92>",
95
+ "<extra_id_93>",
96
+ "<extra_id_94>",
97
+ "<extra_id_95>",
98
+ "<extra_id_96>",
99
+ "<extra_id_97>",
100
+ "<extra_id_98>",
101
+ "<extra_id_99>"
102
+ ]
103
+ }
tokenizer_config.json CHANGED
@@ -1 +1,104 @@
1
- {"eos_token": "</s>", "unk_token": "<unk>", "pad_token": "<pad>", "extra_ids": 0}
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {"eos_token": "</s>", "unk_token": "<unk>", "pad_token": "<pad>",
2
+ "additional_special_tokens": ["<extra_id_0>",
3
+ "<extra_id_1>",
4
+ "<extra_id_2>",
5
+ "<extra_id_3>",
6
+ "<extra_id_4>",
7
+ "<extra_id_5>",
8
+ "<extra_id_6>",
9
+ "<extra_id_7>",
10
+ "<extra_id_8>",
11
+ "<extra_id_9>",
12
+ "<extra_id_10>",
13
+ "<extra_id_11>",
14
+ "<extra_id_12>",
15
+ "<extra_id_13>",
16
+ "<extra_id_14>",
17
+ "<extra_id_15>",
18
+ "<extra_id_16>",
19
+ "<extra_id_17>",
20
+ "<extra_id_18>",
21
+ "<extra_id_19>",
22
+ "<extra_id_20>",
23
+ "<extra_id_21>",
24
+ "<extra_id_22>",
25
+ "<extra_id_23>",
26
+ "<extra_id_24>",
27
+ "<extra_id_25>",
28
+ "<extra_id_26>",
29
+ "<extra_id_27>",
30
+ "<extra_id_28>",
31
+ "<extra_id_29>",
32
+ "<extra_id_30>",
33
+ "<extra_id_31>",
34
+ "<extra_id_32>",
35
+ "<extra_id_33>",
36
+ "<extra_id_34>",
37
+ "<extra_id_35>",
38
+ "<extra_id_36>",
39
+ "<extra_id_37>",
40
+ "<extra_id_38>",
41
+ "<extra_id_39>",
42
+ "<extra_id_40>",
43
+ "<extra_id_41>",
44
+ "<extra_id_42>",
45
+ "<extra_id_43>",
46
+ "<extra_id_44>",
47
+ "<extra_id_45>",
48
+ "<extra_id_46>",
49
+ "<extra_id_47>",
50
+ "<extra_id_48>",
51
+ "<extra_id_49>",
52
+ "<extra_id_50>",
53
+ "<extra_id_51>",
54
+ "<extra_id_52>",
55
+ "<extra_id_53>",
56
+ "<extra_id_54>",
57
+ "<extra_id_55>",
58
+ "<extra_id_56>",
59
+ "<extra_id_57>",
60
+ "<extra_id_58>",
61
+ "<extra_id_59>",
62
+ "<extra_id_60>",
63
+ "<extra_id_61>",
64
+ "<extra_id_62>",
65
+ "<extra_id_63>",
66
+ "<extra_id_64>",
67
+ "<extra_id_65>",
68
+ "<extra_id_66>",
69
+ "<extra_id_67>",
70
+ "<extra_id_68>",
71
+ "<extra_id_69>",
72
+ "<extra_id_70>",
73
+ "<extra_id_71>",
74
+ "<extra_id_72>",
75
+ "<extra_id_73>",
76
+ "<extra_id_74>",
77
+ "<extra_id_75>",
78
+ "<extra_id_76>",
79
+ "<extra_id_77>",
80
+ "<extra_id_78>",
81
+ "<extra_id_79>",
82
+ "<extra_id_80>",
83
+ "<extra_id_81>",
84
+ "<extra_id_82>",
85
+ "<extra_id_83>",
86
+ "<extra_id_84>",
87
+ "<extra_id_85>",
88
+ "<extra_id_86>",
89
+ "<extra_id_87>",
90
+ "<extra_id_88>",
91
+ "<extra_id_89>",
92
+ "<extra_id_90>",
93
+ "<extra_id_91>",
94
+ "<extra_id_92>",
95
+ "<extra_id_93>",
96
+ "<extra_id_94>",
97
+ "<extra_id_95>",
98
+ "<extra_id_96>",
99
+ "<extra_id_97>",
100
+ "<extra_id_98>",
101
+ "<extra_id_99>"
102
+ ],
103
+ "extra_ids": 0
104
+ }