neuralmagic
/

Llama-2-7b-chat-quantized.w8a16

Text Generation

text-generation-inference

Inference Endpoints

8-bit precision

Model card Files Files and versions Community

Llama-2-7b-chat-quantized.w8a16 / generation_config.json

alexmarques's picture

Upload LlamaForCausalLM

33f6b74 verified 4 months ago

history blame contribute delete

111 Bytes

	{
	"_from_model_config": true,
	"bos_token_id": 1,
	"eos_token_id": 2,
	"transformers_version": "4.42.1"
	}