SurahChain d128 Pretrain — نموذج أولي للغة العربية

هذا نموذج أولي (prototype) نُشرَّ بُنية معمارية تجريبية اسمها **سلسلة السور (SurahChain)**، تُدرَّب على نصوص عربية ثم تُنشَر هنا كمرجع مفتوح قابل لإعادة الاستخدام من مشروع Neural Service Mesh (NSM).

ما هذا النموذج؟

SurahChain نموذج لغوي مبني على PyTorch يعالج النص عبر ثلاث مراحل: كتل Transformer كلاسيكية (Pre-Norm) قبل وبعد سلسلة متوسطة مكونة من 114 طبقة متغيرة الأبعاد — تبدأ ضيقة (7) وتتسع إلى 286 ثم تضيق مجددًا — مع بوابات Highway وموازنة طبقات (LayerScale). الفكرة أن كل طبقة تمثل "سورة" من بنية اللغة، والتوسع/التضيق يلتقط التدرج الهرمي من الحرف إلى الجملة.

الخاصية القيمة
البُعد المخفي (d_model) 128
رؤوس الانتباه 8
حجم المفردات 8192 رمزًا
أقصى تسلسل 256
طبقات سلسلة السور 114
كتل Transformer قبل/بعد 2 / 2
المعاملات ≈ 2.4M

التدريب

دُرّب على 30,000 جملة عربية عبر 95 epoch على Kaggle GPU (الطبقة المجانية)، بمحسّن AdamW (lr=0.001) وglobal_step=84,420. خسارته النهائية ≈ 2.788. أثناء التدريب توسّعت طبقتان في السلسلة ديناميكيًا (epoch 17 و19) وفق آلية "توسيع الأضيق" — الأبعاد النهائية المحسوبة محفوظة في config.json.

هذا نموذج بحثي تجريبي (toy/prototype) — لا يصلح للاستخدام الإنتاجي ولا يُنشئ إجابات مفيدة بعد. الهدف هو توثيق ونشر البنية المعمارية وإتاحة إعادة إنتاجها.

التحميل والاستخدام

from model import load_model, generate_text

model, tokenizer = load_model("latest_pretrain_torch.pt", "tokenizer_vocab_pretrain_d128_s1p0.json")
print(generate_text(model, tokenizer, "في البداية كان"))

الملفات:

الملف الوصف
latest_pretrain_torch.pt أوزان PyTorch (44MB، حالة كاملة: model + tokenizer state)
model.py كود النموذج المستقل (قابل للتشغيل بذاته)
config.json الإعدادات + أبعاد السلسلة النهائية المدربة
tokenizer_vocab_pretrain_d128_s1p0.json قاموس المفردات

روابط المشروع

Downloads last month
11
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support