from m31_runtime import load_stage from generation_m31 import generate model, tokenizer, config = load_stage("repair") prompt = "Write a Python function that returns factorial of n." print(generate(model, tokenizer, prompt, max_new_tokens=256, temperature=0.7, top_p=0.9, repetition_penalty=1.05, max_context=512))