HuggingFaceFW/fineweb-edu
Viewer • Updated • 3.5B • 397k • 1.28k
Mnemosyne-64M is the foundational base model for the Hierarchical Chunk Attention (HCA) architecture, pre-trained from scratch on 1.28 Billion tokens using a single NVIDIA GeForce RTX 3090.
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "BIBLIOKLEPT/Mnemosyne-64M"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id,
dtype=torch.bfloat16,
device_map="cuda",
trust_remote_code=True
)
prompt = "The phenomenon of gravity is defined as"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
with torch.no_grad():
outputs = model.generate(**inputs, max_new_tokens=100, do_sample=True, temperature=0.6)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))