Athena-7B-Instruct

A multilingual instruction-tuned language model with 7.2B parameters, pre-trained on 2.5T tokens across 60+ languages.

Architecture

  • Parameters: 7.2B
  • Layers: 32, Hidden: 4096, Attention heads: 32
  • KV heads: 8 (GQA), Context: 8192
  • Vocab: 128,256

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(
    "Mewingk/athena-7b-instruct",
    torch_dtype="auto",
    device_map="auto",
    trust_remote_code=True
)
tokenizer = AutoTokenizer.from_pretrained("Mewingk/athena-7b-instruct", trust_remote_code=True)

messages = [{"role": "user", "content": "Hello!"}]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt")
outputs = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

License

Apache 2.0

Downloads last month
248
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support