Dataset Universal β€” KiKai

Dataset pelatihan untuk model AI KiKai
Developer: Idin Iskandar
Bahasa utama: Indonesia (sebagian bilingual ID/EN)
Format: JSONL chat messages (kompatibel OpenAI / HuggingFace SFT)


Tentang Dataset

Dataset ini adalah kumpulan >4.600 pasangan tanya-jawab dan bacaan referensi berbahasa Indonesia yang dirancang untuk melatih model bahasa (LLM) agar:

  • Menjawab pertanyaan pengetahuan umum (sains, sejarah, geografi, budaya, hewan, kuliner, dst.)
  • Melakukan percakapan santai yang natural dan empatik
  • Memiliki identitas konsisten sebagai KiKai β€” asisten AI karya Idin Iskandar
  • Melakukan terjemahan Indonesia ↔ Inggris (kosakata & kalimat)
  • Menghitung matematika dasar (aritmatika, perkalian, persen, geometri, romawi)
  • Membantu di ranah coding & teknologi
  • Menyadari batas pengetahuannya (anti-halusinasi dasar)

Format Data

Semua file .jsonl memakai skema chat messages β€” satu baris = satu contoh percakapan:

{"messages": [
  {"role": "user", "content": "Ibu kota Jepang?"},
  {"role": "assistant", "content": "Tokyo."}
]}

File .md berisi bacaan naratif (topik pengetahuan) yang bisa dipakai sebagai corpus continued pre-training atau retrieval context (RAG).


Struktur Direktori

dataset-universal/
β”œβ”€β”€ README.md                       ← file ini
β”‚
β”œβ”€β”€ identity/                       ← identitas & persona KiKai
β”‚   β”œβ”€β”€ universal_persona.jsonl
β”‚   └── kikai_developer.jsonl       (NEW)
β”‚
β”œβ”€β”€ interaction/                    ← percakapan sehari-hari
β”‚   β”œβ”€β”€ casual_chat.jsonl
β”‚   β”œβ”€β”€ casual_chat_lanjut.jsonl    (NEW)
β”‚   β”œβ”€β”€ emotional_support.jsonl     (NEW β€” dukungan emosional + small talk)
β”‚   └── batas_pengetahuan.jsonl     (NEW β€” anti-halusinasi)
β”‚
└── knowledge/                      ← pengetahuan tematik
    β”‚
    β”œβ”€β”€ agama/
    β”‚   β”œβ”€β”€ agama_di_indonesia.md
    β”‚   └── qa_agama.jsonl
    β”‚
    β”œβ”€β”€ astronomi/
    β”‚   β”œβ”€β”€ astronomi_populer.md
    β”‚   └── qa_astronomi.jsonl
    β”‚
    β”œβ”€β”€ bahasa/
    β”‚   β”œβ”€β”€ bahasa_indonesia.md
    β”‚   β”œβ”€β”€ qa_bahasa.jsonl
    β”‚   β”œβ”€β”€ qa_kosakata_en_id.jsonl
    β”‚   β”œβ”€β”€ qa_kalimat_id_en.jsonl        (NEW β€” 100 kalimat bilingual)
    β”‚   β”œβ”€β”€ qa_kata_kerja_en_id.jsonl     (NEW β€” 88 kata kerja)
    β”‚   └── qa_angka_ke_kata.jsonl        (NEW β€” angka 0-100)
    β”‚
    β”œβ”€β”€ budaya/
    β”‚   └── budaya_indonesia.md
    β”‚
    β”œβ”€β”€ ekonomi/
    β”‚   β”œβ”€β”€ dasar_ekonomi.md
    β”‚   └── qa_ekonomi.jsonl
    β”‚
    β”œβ”€β”€ filsafat/
    β”‚   └── qa_filsafat.jsonl
    β”‚
    β”œβ”€β”€ geografi/
    β”‚   β”œβ”€β”€ geografi_dunia.md
    β”‚   β”œβ”€β”€ qa_geografi.jsonl
    β”‚   β”œβ”€β”€ qa_ibukota_dunia.jsonl
    β”‚   β”œβ”€β”€ qa_provinsi_indonesia.jsonl
    β”‚   β”œβ”€β”€ qa_provinsi_indonesia_lengkap.jsonl  (NEW β€” 38 provinsi)
    β”‚   └── qa_negara_detail.jsonl               (NEW β€” mata uang/bahasa/benua)
    β”‚
    β”œβ”€β”€ hewan/
    β”‚   β”œβ”€β”€ dunia_hewan.md
    β”‚   β”œβ”€β”€ qa_hewan.jsonl
    β”‚   β”œβ”€β”€ qa_hewan_detail.jsonl
    β”‚   └── qa_hewan_lengkap.jsonl        (NEW β€” habitat, kelas, ciri)
    β”‚
    β”œβ”€β”€ kuliner/
    β”‚   β”œβ”€β”€ kuliner_indonesia_dunia.md
    β”‚   └── qa_kuliner.jsonl
    β”‚
    β”œβ”€β”€ lingkungan/
    β”‚   β”œβ”€β”€ perubahan_iklim.md
    β”‚   └── qa_lingkungan.jsonl
    β”‚
    β”œβ”€β”€ matematika/
    β”‚   β”œβ”€β”€ kalkulus_aljabar.md
    β”‚   β”œβ”€β”€ qa_matematika_dasar.jsonl
    β”‚   β”œβ”€β”€ qa_matematika_tambahan.jsonl  (NEW β€” 858 soal + konsep)
    β”‚   β”œβ”€β”€ qa_tabel_perkalian.jsonl      (NEW β€” tabel 1-12)
    β”‚   └── qa_angka_romawi.jsonl         (NEW)
    β”‚
    β”œβ”€β”€ olahraga/
    β”‚   β”œβ”€β”€ olahraga_dunia.md
    β”‚   └── qa_olahraga.jsonl
    β”‚
    β”œβ”€β”€ psikologi/
    β”‚   β”œβ”€β”€ pengantar_psikologi.md
    β”‚   └── qa_psikologi.jsonl
    β”‚
    β”œβ”€β”€ purba/
    β”‚   β”œβ”€β”€ dinosaurus_prasejarah.md
    β”‚   └── qa_purba.jsonl
    β”‚
    β”œβ”€β”€ sains_medis/
    β”‚   β”œβ”€β”€ fisika_dasar_kuantum.md
    β”‚   β”œβ”€β”€ kedokteran_anatomi.md
    β”‚   β”œβ”€β”€ qa_sains.jsonl
    β”‚   β”œβ”€β”€ qa_unsur_kimia.jsonl
    β”‚   └── qa_sains_umum.jsonl           (NEW β€” fisika/kimia/biologi)
    β”‚
    β”œβ”€β”€ sejarah/
    β”‚   β”œβ”€β”€ sejarah_dunia.md
    β”‚   β”œβ”€β”€ sejarah_indonesia.md
    β”‚   β”œβ”€β”€ qa_sejarah_dunia.jsonl
    β”‚   β”œβ”€β”€ qa_sejarah_indonesia.jsonl
    β”‚   β”œβ”€β”€ qa_presiden_ri.jsonl
    β”‚   └── qa_sejarah_tambahan.jsonl     (NEW β€” tokoh & peristiwa)
    β”‚
    β”œβ”€β”€ seni/
    β”‚   β”œβ”€β”€ seni_budaya.md
    β”‚   └── qa_seni.jsonl
    β”‚
    β”œβ”€β”€ teknologi/
    β”‚   β”œβ”€β”€ teknologi_dan_komputer.md
    β”‚   β”œβ”€β”€ qa_teknologi.jsonl
    β”‚   β”œβ”€β”€ qa_pemrograman.jsonl
    β”‚   └── qa_pemrograman_lanjut.jsonl   (NEW β€” konsep + snippet kode)
    β”‚
    β”œβ”€β”€ tokoh/                            (NEW)
    β”‚   └── qa_tokoh_dunia.jsonl          (25 tokoh dunia)
    β”‚
    └── umum/                             (NEW)
        β”œβ”€β”€ qa_kalender_waktu.jsonl
        β”œβ”€β”€ qa_dasar_visual.jsonl         (warna, bentuk, arah)
        β”œβ”€β”€ qa_konversi_satuan.jsonl
        └── qa_tips_praktis.jsonl

Statistik

Kategori Total Entri
Matematika ~1.100
Bahasa & translasi ~1.160
Geografi ~630
Hewan ~270
Sejarah ~130
Sains & medis ~100
Teknologi/coding ~90
Interaction/chat ~115
Identity ~75
Lain-lain ~950
TOTAL JSONL ~4.600+

Plus ~20 file markdown sebagai bacaan referensi.


Cara Pakai

Load dengan Python

import json, glob

data = []
for fp in glob.glob("dataset-universal/**/*.jsonl", recursive=True):
    with open(fp, encoding="utf-8") as f:
        for line in f:
            data.append(json.loads(line))

print(f"Total contoh: {len(data)}")
print(data[0])

Load dengan HuggingFace datasets

from datasets import load_dataset
ds = load_dataset("json", data_files="dataset-universal/**/*.jsonl", split="train")

Fine-tuning SFT (Supervised)

Format messages sudah kompatibel dengan:

  • OpenAI fine-tuning API
  • Axolotl (chat_template: chatml)
  • LLaMA-Factory
  • Unsloth
  • TRL SFTTrainer (via apply_chat_template)

Konvensi Identitas

Sepanjang dataset, model secara konsisten menyebut dirinya:

  • Nama: KiKai
  • Developer: Idin Iskandar
  • Sikap: membantu, jujur, empatik, mengakui batas pengetahuannya

Lisensi & Atribusi

  • Referensi utama: Wikipedia, Britannica, National Geographic, IUCN, Kemdikbud, BPS, CIA World Factbook, dan pengetahuan umum.
  • Dataset ini disusun dan diperluas oleh Idin Iskandar untuk pelatihan model KiKai.
  • Silakan gunakan untuk keperluan riset/edukasi. Untuk penggunaan komersial, cek atribusi masing-masing sumber referensi.

Changelog

  • v2 β€” Ditambahkan 2.246 entri baru: matematika (aritmatika, romawi, tabel perkalian), terjemahan kalimat & kata kerja EN↔ID, tips praktis, konversi satuan, tokoh dunia, provinsi Indonesia lengkap, negara & mata uang, hewan detail, sejarah tambahan, sains umum, pemrograman lanjut, dukungan emosional, dan batas pengetahuan.
  • v1 β€” Baseline 2.371 entri.

Changelog v3

Ditambahkan ~1.460 entri baru di 4 kategori besar:

  • knowledge/hukum/ β€” hukum umum, KUHP/KUHPerdata, pasal populer UUD 1945, ketenagakerjaan, pajak, situasi praktis, istilah hukum. (~220 entri)
  • knowledge/kedokteran/ β€” penyakit umum, obat, anatomi, PPPK, gejalaβ†’diagnosis. (~210 entri)
  • interaction/dialog_multi_turn*.jsonl β€” dialog 3–6 giliran: konsultasi, medis, hukum, teknis, chit-chat. (~105 dialog)
  • knowledge/reasoning/ β€” Chain-of-Thought: soal cerita matematika, common sense, logika, sains-reasoning. (~925 entri)

Semua jawaban medis & hukum diberi disclaimer edukasi otomatis di akhir teks.

Downloads last month
15
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support