SurahChain d128 Pretrain — نموذج أولي للغة العربية
هذا نموذج أولي (prototype) نُشرَّ بُنية معمارية تجريبية اسمها **سلسلة السور (SurahChain)**، تُدرَّب على نصوص عربية ثم تُنشَر هنا كمرجع مفتوح قابل لإعادة الاستخدام من مشروع Neural Service Mesh (NSM).
ما هذا النموذج؟
SurahChain نموذج لغوي مبني على PyTorch يعالج النص عبر ثلاث مراحل: كتل Transformer كلاسيكية (Pre-Norm) قبل وبعد سلسلة متوسطة مكونة من 114 طبقة متغيرة الأبعاد — تبدأ ضيقة (7) وتتسع إلى 286 ثم تضيق مجددًا — مع بوابات Highway وموازنة طبقات (LayerScale). الفكرة أن كل طبقة تمثل "سورة" من بنية اللغة، والتوسع/التضيق يلتقط التدرج الهرمي من الحرف إلى الجملة.
| الخاصية | القيمة |
|---|---|
| البُعد المخفي (d_model) | 128 |
| رؤوس الانتباه | 8 |
| حجم المفردات | 8192 رمزًا |
| أقصى تسلسل | 256 |
| طبقات سلسلة السور | 114 |
| كتل Transformer قبل/بعد | 2 / 2 |
| المعاملات | ≈ 2.4M |
التدريب
دُرّب على 30,000 جملة عربية عبر 95 epoch على Kaggle GPU (الطبقة المجانية)، بمحسّن AdamW (lr=0.001) وglobal_step=84,420. خسارته النهائية ≈ 2.788. أثناء التدريب توسّعت طبقتان في السلسلة ديناميكيًا (epoch 17 و19) وفق آلية "توسيع الأضيق" — الأبعاد النهائية المحسوبة محفوظة في config.json.
هذا نموذج بحثي تجريبي (toy/prototype) — لا يصلح للاستخدام الإنتاجي ولا يُنشئ إجابات مفيدة بعد. الهدف هو توثيق ونشر البنية المعمارية وإتاحة إعادة إنتاجها.
التحميل والاستخدام
from model import load_model, generate_text
model, tokenizer = load_model("latest_pretrain_torch.pt", "tokenizer_vocab_pretrain_d128_s1p0.json")
print(generate_text(model, tokenizer, "في البداية كان"))
الملفات:
| الملف | الوصف |
|---|---|
latest_pretrain_torch.pt |
أوزان PyTorch (44MB، حالة كاملة: model + tokenizer state) |
model.py |
كود النموذج المستقل (قابل للتشغيل بذاته) |
config.json |
الإعدادات + أبعاد السلسلة النهائية المدربة |
tokenizer_vocab_pretrain_d128_s1p0.json |
قاموس المفردات |
روابط المشروع
- المستودع الرئيسي: Neural Service Mesh على GitHub
- التطبيق الحي: Neural Service Mesh على Streamlit
- كيرنل التدريب على Kaggle: notebookc3a17dd093
- Downloads last month
- 11