How to use

from datasets import load_dataset
from transformers import pipeline, AutoTokenizer
from sklearn.metrics import accuracy_score, f1_score

model_name = "0x404/Qwen2.5-Coder-7B-ccs"

test_dataset = load_dataset("0x404/ccs_dataset", split="test")
tokenizer = AutoTokenizer.from_pretrained(model_name)

def apply_prompt_template(row):
    prompt = tokenizer.init_kwargs["ccs_prompt_template"].format(
        diff=row["git_diff"], 
        message=row["masked_commit_message"]
    )
    return {"input_prompt": prompt}

test_dataset_with_prompts = test_dataset.map(apply_prompt_template)

pipe = pipeline("text-generation", model=model_name, device_map="auto")
outputs = pipe(test_dataset_with_prompts["input_prompt"], max_new_tokens=10, pad_token_id=pipe.tokenizer.eos_token_id)
predicted_labels = [output[0]["generated_text"].split()[-1] for output in outputs]

accuracy = accuracy_score(test_dataset["annotated_type"], predicted_labels)
f1 = f1_score(test_dataset["annotated_type"], predicted_labels, average="macro")

print("Accuracy:", accuracy)
print("F1 Score (Macro):", f1)
Downloads last month
7
Safetensors
Model size
8B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for 0x404/Qwen2.5-Coder-7B-ccs

Quantizations
1 model