Experimental SLM — Cisya Lab
Building Cisya from Curiosity
Cisya adalah nama dari sebuah Small Language Model (SLM) yang dibangun dari nol sebagai bagian dari proyek pembelajaran AI. Perjalanan ini mendokumentasikan seluruh proses pembuatan model bahasa secara transparan: dari persiapan dataset, kustomisasi tokenizer, skrip Python, sesi terminal, hingga tahap pre-training dan Supervised Fine-Tuning (SFT) pada hardware lokal.
Dari pengalaman eksperimen tersebut, lahirlah Cisya Studio—sebuah aplikasi desktop yang dirancang untuk menyederhanakan proses melatih dan memodelkan AI agar lebih ramah pengguna, mudah dieksplorasi, dan dapat didokumentasikan.
Tags Identitas: Cisya_v2.0 | Smart-Absurd
Active Research: Open the Blackbox
Banyak orang percaya bahwa membangun AI membutuhkan dataset raksasa, GPU mahal, dan infrastruktur industri. Cisya Lab hadir untuk membuktikan bahwa tujuannya bukan untuk membangun AI terbesar di dunia, melainkan untuk memahami bagaimana AI itu bekerja dari dalam kotak hitamnya.
Pelajaran Penting dari Pembangunan Cisya:
- Dataset Matters: Kualitas dataset yang bersih dan konsisten memberikan dampak jauh lebih signifikan dibanding sekadar menambah kuantitas data.
- Small Doesn't Mean Simple: Model berukuran kecil tetap mampu mempelajari pola bahasa yang kompleks jika diberi konfigurasi dan dataset yang tepat.
- Character Emerges Faster: Gaya bahasa, kepribadian, dan identitas unik lebih cepat terbentuk pada model kecil.
- Strong Foundations Matter: Tokenizer yang tepat dan fondasi dataset yang rapi menentukan keberhasilan pembelajaran sejak awal.
Fitur Utama Cisya Studio
Cisya Studio menyediakan alat lengkap untuk melatih Small Language Model secara lokal:
- Build Tokenizer: Mengubah teks dataset menjadi vocabulary sederhana agar model dapat belajar membaca token demi token.
- Pretraining Engine: Melatih model bahasa dasar dari nol menggunakan preset konfigurasi yang disederhanakan.
- SFT Trainer (Instruction Following): Melanjutkan model hasil pretraining agar mampu mengikuti instruksi, merespons arahan, dan membentuk karakter khusus.
- Chat Playground: Menguji respons model secara langsung dan melihat hasil generasi teks berdasarkan pola yang dipelajari.
- Project System: Manajemen terpisah untuk setiap eksperimen (termasuk dataset, tokenizer, checkpoint, log, dan parameter).
- GPU Detection: Mendeteksi hardware lokal secara otomatis dan memberikan rekomendasi konfigurasi training yang optimal.
- Dataset Analyzer: Menganalisis dataset sebelum training untuk mendeteksi duplikasi, format tidak valid, dan statistik dasar.
- Modern & Custom Architecture: Eksplorasi komponen arsitektur modern seperti RMSNorm, SwiGLU, RoPE, Attention Variants, kustomisasi context length, serta pengaturan special tokens.
Edisi Cisya Studio (Release Editions)
- Basic Edition: Versi awal fokus pembelajaran alur dasar (Tokenizer, Pretraining, CPU/GPU Mode, Playground).
- SFT Edition: Versi lanjutan untuk membentuk model asisten dengan kemampuan *instruction following* dan *character building*.
- Advanced Edition: Dirancang untuk eksperimen mendalam dengan kustomisasi arsitektur modern, multi-line training, dan hyperparameter tingkat lanjut.