language: - fa - en license: apache-2.0 base_model: Qwen/Qwen2.5-3B pipeline_tag: text-generation tags: - text-generation - qwen2 - moeingts - persian

🚀 moeinGTS 1.5 - 3B

moeinGTS 1.5-3B یک مدل زبانی فشرده، قدرتمند و بهینه‌شده برای زبان فارسی است که بر پایه معماری Qwen2.5 آموزش دیده و توسعه یافته است.


📌 ویژگی‌های کلیدی

  • پشتیبانی قوی از زبان فارسی: درک عمیق دستورات متنی، خلاصه سازی و پاسخ‌دهی روان.
  • بهینه‌شده برای اجرا روی سیستم‌های خانگی: قابلیت اجرا روی GPUهای معمولی و حتی CPU (با فرمت GGUF).
  • مناسب برای چت و اتوماسیون: سازگار با اکوسیستم‌های Ollama و Transformers.

📊 جزئیات آموزش (Training Details)

  • مدل پایه (Base Model): Qwen2.5-3B
  • روش آموزش: Instruction Fine-Tuning با استفاده از روش LoRA / PEFT
  • سخت‌افزار آموزش: NVIDIA T4 / A100 GPUs
  • Hyperparameters:
    • Learning Rate: 2e-4
    • Batch Size: 4
    • Gradient Accumulation Steps: 4
    • Optimizer: AdamW

🏎️ نحوه استفاده (Usage)

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo_id = "ali-arshiya/moeinGTS1.5-3b"

tokenizer = AutoTokenizer.from_pretrained(repo_id)
model = AutoModelForCausalLM.from_pretrained(
    repo_id,
    torch_dtype=torch.float16,
    device_map="auto"
)

prompt = "اروش‌های بهبود کارایی مدل‌های هوش مصنوعی چیست؟"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")

outputs = model.generate(**inputs, max_new_tokens=150)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Downloads last month
479
Safetensors
Model size
3B params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ali-arshiya/moeinGTS1.5-3b

Quantizations
1 model