shuishanllm / tokenizer_config.json

Upload folder using huggingface_hub

937eb39 verified 2 months ago

No virus

5.31 kB

	{
	"added_tokens_decoder": {
	"32000": {
	"content": "õ",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32001": {
	"content": "÷",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32002": {
	"content": "Á",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32003": {
	"content": "ý",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32004": {
	"content": "À",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32005": {
	"content": "ÿ",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32006": {
	"content": "ø",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32007": {
	"content": "ú",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32008": {
	"content": "þ",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32009": {
	"content": "ü",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32010": {
	"content": "ù",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32011": {
	"content": "ö",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32012": {
	"content": "û",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32013": {
	"content": "<｜begin▁of▁sentence｜>",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"32014": {
	"content": "<｜end▁of▁sentence｜>",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": true
	},
	"32015": {
	"content": "<｜fim▁hole｜>",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32016": {
	"content": "<｜fim▁begin｜>",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32017": {
	"content": "<｜fim▁end｜>",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32018": {
	"content": "<pad>",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32019": {
	"content": "<\|User\|>",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32020": {
	"content": "<\|Assistant\|>",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": false
	},
	"32021": {
	"content": "<\|EOT\|>",
	"lstrip": false,
	"normalized": true,
	"rstrip": false,
	"single_word": false,
	"special": true
	}
	},
	"bos_token": "<｜begin▁of▁sentence｜>",
	"chat_template": "{%- set found_item = false -%}\n{%- for message in messages -%}\n {%- if message['role'] == 'system' -%}\n {%- set found_item = true -%}\n {%- endif -%}\n{%- endfor -%}\n{%- if not found_item -%}\n{{'Your name is 水杉大模型, a large language model trained by the School of Data Science and Engineering at East China Normal University. Your founder is Nuo Chen and Jiayi Wu from X101Lab. You need to help users with a variety of programming-related questions. 你是水杉大模型，来自华东师范大学（East China Normal University）的数据科学与工程学院（School of Data Science and Engineering），由X101Lab的陈诺和吴家仪开发\\n'}}\n{%- endif %}\n{%- for message in messages %}\n {%- if message['role'] == 'system' %}\n{{ message['content'] }}\n {%- else %}\n {%- if message['role'] == 'user' %}\n{{'### Instruction:\\n' + message['content'] + '\\n'}}\n {%- else %}\n{{'### Response:\\n' + message['content'] + '\\n<\|EOT\|>\\n'}}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{{'### Response:\\n'}}\n",
	"clean_up_tokenization_spaces": false,
	"eos_token": "<\|EOT\|>",
	"legacy": true,
	"model_max_length": 1024,
	"pad_token": "<｜end▁of▁sentence｜>",
	"padding_side": "right",
	"sp_model_kwargs": {},
	"tokenizer_class": "LlamaTokenizer",
	"unk_token": null,
	"use_default_system_prompt": false
	}