Aksara Mini-LM v3 β€” Model Bahasa Indonesia (dibangun dari nol)

Model bahasa dibuat sendiri dengan bahasa pemrograman Aksara β€” bukan turunan model pihak lain, bukan download dari orang. Arsitektur, tokenizer, dan pipeline training 100% milik sendiri.

Fokus Domain

  • Bug Hunting (metodologi defensif: recon, scope, IDOR, XSS, SQLi, SSRF, report)
  • Python
  • Aksara
  • JavaScript
  • Kotlin / Android

Bahasa: Indonesia (utama) + Inggris (bantuan).

Arsitektur

Komponen Deskripsi
Tokenizer BPE (vocab 500) dilatih dari korpus Indonesia sendiri
Model Mini-LM v3: embed + multi-head attention + LayerNorm + FFN-MoE (2 pakar)
Dimensi hidden 128, 4 kepala, 2 layer
Quantisasi int8 (hemat 82.9% bobot)
Korpus 441KB (terkompres LZMA 72%) β€” fokus bug hunting + 4 bahasa

Isi Repo

aksara_ai/     # backend numerik (numpy murni, dari nol)
aksara_stdlib/ # pustaka standar Aksara (.ak)
data/          # vocab kosakata terkompres (415B)
korpus/        # korpus terkompres LZMA (.akxz)
app/           # chatbot, bot telegram, pipeline training

Cara Menjalankan (offline, CPU)

# instal Aksara interpreter
pip install -e .
# chat interaktif
python3 -m aksara app/chatgpt_ak.ak
# bot telegram (ganti token)
TELEGRAM_TOKEN=xxxx bash app/jalankan_bot.sh

Training Ulang (di Spaces / hardware lebih besar)

python3 -m aksara app/training_fokus.ak

Pipeline: korpus β†’ BPE β†’ Mini-LM v3 β†’ generate β†’ kompres.

Model Hasil Training Cloud

model_v3_colab.aksm β€” hasil training di Google Colab (GPU), lebih besar dari versi HP:

  • 1.344.602 parameter (6x dari versi HP)
  • hidden 128, 4 kepala, 2 layer, MoE 4 pakar
  • 2000 iterasi, 120k token latih
  • Ukuran 10.3 MB

Catatan jujur: output generatif masih tahap awal (belum sepenuhnya membentuk kalimat bermakna). Ini JALAN PROGRESIF β€” fondasi siap di-upgrade dengan data & hardware lebih besar.

Keterbatasan (jujur)

  • Mini-LM v3 ukuran kecil β€” output generatif masih terbatas; dikuatkan lapis pakar (rule + semantik + inferensi) yang sudah terverifikasi.
  • Training penuh skala besar butuh hardware lebih dari HP (Space/training).

Dibuat dengan Aksara β€” bahasa pemrograman Indonesia for AI.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Dataset used to train Jokoboy/aksara-model

Space using Jokoboy/aksara-model 1