Jokoboy/aksara-corpus
Updated β’ 18
Model bahasa dibuat sendiri dengan bahasa pemrograman Aksara β bukan turunan model pihak lain, bukan download dari orang. Arsitektur, tokenizer, dan pipeline training 100% milik sendiri.
Bahasa: Indonesia (utama) + Inggris (bantuan).
| Komponen | Deskripsi |
|---|---|
| Tokenizer | BPE (vocab 500) dilatih dari korpus Indonesia sendiri |
| Model | Mini-LM v3: embed + multi-head attention + LayerNorm + FFN-MoE (2 pakar) |
| Dimensi | hidden 128, 4 kepala, 2 layer |
| Quantisasi | int8 (hemat 82.9% bobot) |
| Korpus | 441KB (terkompres LZMA 72%) β fokus bug hunting + 4 bahasa |
aksara_ai/ # backend numerik (numpy murni, dari nol)
aksara_stdlib/ # pustaka standar Aksara (.ak)
data/ # vocab kosakata terkompres (415B)
korpus/ # korpus terkompres LZMA (.akxz)
app/ # chatbot, bot telegram, pipeline training
# instal Aksara interpreter
pip install -e .
# chat interaktif
python3 -m aksara app/chatgpt_ak.ak
# bot telegram (ganti token)
TELEGRAM_TOKEN=xxxx bash app/jalankan_bot.sh
python3 -m aksara app/training_fokus.ak
Pipeline: korpus β BPE β Mini-LM v3 β generate β kompres.
model_v3_colab.aksm β hasil training di Google Colab (GPU), lebih besar dari
versi HP:
Catatan jujur: output generatif masih tahap awal (belum sepenuhnya membentuk kalimat bermakna). Ini JALAN PROGRESIF β fondasi siap di-upgrade dengan data & hardware lebih besar.
Dibuat dengan Aksara β bahasa pemrograman Indonesia for AI.