Commit from local

Browse files

Files changed (9) hide show

added_tokens.json +4 -0
alphabet.json +1 -0
language_model/attrs.json +1 -0
language_model/bts.mclass.lm +0 -0
language_model/unigrams.txt +0 -0
preprocessor_config.json +10 -0
special_tokens_map.json +50 -0
tokenizer_config.json +14 -0
vocab.json +72 -0

added_tokens.json ADDED Viewed

	@@ -0,0 +1,4 @@

+{
+  "</s>": 71,
+  "<s>": 70
+}

alphabet.json ADDED Viewed

	@@ -0,0 +1 @@

+ {"labels": ["\u0e37", "\u0e0a", "\u0e2e", "\u0e08", "\u0e31", "\u0e2b", "\u0e09", "\u0e04", "\u0e02", "\u0e06", "\u0e49", "\u0e27", "\u0e22", "\u0e2f", "\u0e43", "\u0e20", "\u0e23", "\u0e48", "\u0e14", "\u0e33", "\u0e42", "\u0e4b", "\u0e24", "\u0e0e", "\u0e45", "\u0e40", "\u0e16", "\u0e1c", "\u0e34", "\u0e13", "\u0e1a", "\u0e1d", "\u0e0c", "\u0e17", "\u0e15", "\u0e10", "\u0e11", "\u0e12", "\u0e28", "\u0e4a", "\u0e2c", "\u0e30", "\u0e41", "\u0e01", "\u0e47", "\u0e39", " ", "\u0e32", "\u0e0d", "\u0e18", "\u0e36", "\u0e07", "\u0e29", "\u0e35", "\u0e19", "\u0e25", "\u0e0b", "\u0e0f", "\u0e2a", "\u0e44", "\u0e38", "\u0e2d", "\u0e1e", "\u0e1f", "\u0e03", "\u0e1b", "\u0e21", "\u0e4c", "\u2047", "", "<s>", "</s>"], "is_bpe": false}

language_model/attrs.json ADDED Viewed

	@@ -0,0 +1 @@


1	+ {"alpha": 0.5, "beta": 1.5, "unk_score_offset": -10.0, "score_boundary": true}

language_model/bts.mclass.lm ADDED Viewed

The diff for this file is too large to render. See raw diff

language_model/unigrams.txt ADDED Viewed

File without changes

preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,10 @@

+{
+  "do_normalize": true,
+  "feature_extractor_type": "Wav2Vec2FeatureExtractor",
+  "feature_size": 1,
+  "padding_side": "right",
+  "padding_value": 0.0,
+  "processor_class": "Wav2Vec2ProcessorWithLM",
+  "return_attention_mask": false,
+  "sampling_rate": 16000
+}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,50 @@

+{
+  "additional_special_tokens": [
+    {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false
+    },
+    {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false
+    },
+    {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false
+    },
+    {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false
+    },
+    {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false
+    },
+    {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false
+    }
+  ],
+  "bos_token": "<s>",
+  "eos_token": "</s>",
+  "pad_token": "[PAD]",
+  "unk_token": "[UNK]"
+}

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,14 @@

+{
+  "bos_token": "<s>",
+  "clean_up_tokenization_spaces": true,
+  "do_lower_case": false,
+  "eos_token": "</s>",
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": "[PAD]",
+  "processor_class": "Wav2Vec2ProcessorWithLM",
+  "replace_word_delimiter_char": " ",
+  "tokenizer_class": "Wav2Vec2CTCTokenizer",
+  "trust_remote_code": false,
+  "unk_token": "[UNK]",
+  "word_delimiter_token": "|"
+}

vocab.json ADDED Viewed

	@@ -0,0 +1,72 @@

+{
+  "[PAD]": 69,
+  "[UNK]": 68,
+  "|": 46,
+  "ก": 43,
+  "ข": 8,
+  "ฃ": 64,
+  "ค": 7,
+  "ฆ": 9,
+  "ง": 51,
+  "จ": 3,
+  "ฉ": 6,
+  "ช": 1,
+  "ซ": 56,
+  "ฌ": 32,
+  "ญ": 48,
+  "ฎ": 23,
+  "ฏ": 57,
+  "ฐ": 35,
+  "ฑ": 36,
+  "ฒ": 37,
+  "ณ": 29,
+  "ด": 18,
+  "ต": 34,
+  "ถ": 26,
+  "ท": 33,
+  "ธ": 49,
+  "น": 54,
+  "บ": 30,
+  "ป": 65,
+  "ผ": 27,
+  "ฝ": 31,
+  "พ": 62,
+  "ฟ": 63,
+  "ภ": 15,
+  "ม": 66,
+  "ย": 12,
+  "ร": 16,
+  "ฤ": 22,
+  "ล": 55,
+  "ว": 11,
+  "ศ": 38,
+  "ษ": 52,
+  "ส": 58,
+  "ห": 5,
+  "ฬ": 40,
+  "อ": 61,
+  "ฮ": 2,
+  "ฯ": 13,
+  "ะ": 41,
+  "ั": 4,
+  "า": 47,
+  "ำ": 19,
+  "ิ": 28,
+  "ี": 53,
+  "ึ": 50,
+  "ื": 0,
+  "ุ": 60,
+  "ู": 45,
+  "เ": 25,
+  "แ": 42,
+  "โ": 20,
+  "ใ": 14,
+  "ไ": 59,
+  "ๅ": 24,
+  "็": 44,
+  "่": 17,
+  "้": 10,
+  "๊": 39,
+  "๋": 21,
+  "์": 67
+}