Semua Proyek/Stunting Classification

← Kembali ke semua proyek

Machine Learning · Data Analytics

Stunting Classification

Pipeline modular untuk mengaudit, membersihkan, memodelkan, mengevaluasi, dan melaporkan klasifikasi stunting menggunakan data SSGI 2024.

  • 2026Tahun
  • Research supportKonteks
  • Machine LearningPeran utama
284.776observasi akhir
152fitur akhir
85,38%akurasi 5-fold CV
Perbandingan akurasi lima model klasifikasi stunting
Perbandingan rata-rata akurasi lima algoritma pada data uji binary dengan 5-fold cross validation. Gradient Boosting menghasilkan akurasi tertinggi sebesar 85,38%.

01 · Masalah

Data besar membutuhkan audit yang dapat ditelusuri

Data survei berskala besar memiliki struktur, tipe variabel, nilai hilang, dan distribusi kelas yang perlu diperiksa secara sistematis. Pipeline dibuat agar setiap perubahan dari data mentah menuju dataset analisis tercatat dan dapat diperiksa kembali.

Jumlah 284.776 merupakan observasi setelah proses pembersihan dan validasi, bukan jumlah data mentah.

02 · Kontribusi

Bagian yang saya kerjakan

Audit & preprocessing

Memeriksa kualitas data, memilih fitur, melakukan encoding, scaling, dan validasi dataset akhir.

Eksperimen model

Membandingkan lima algoritma pada skenario binary dan multiclass dengan proses evaluasi yang konsisten.

Evaluasi & pelaporan

Menyusun metrik, visualisasi, interpretasi SHAP, serta materi hasil untuk mendukung persiapan riset.

03 · Keputusan teknis

Menjaga evaluasi tetap adil

  1. 01

    Audit

    Memetakan perubahan jumlah observasi dan fitur.

  2. 02

    Prepare

    Menyiapkan data sesuai kebutuhan tiap algoritma.

  3. 03

    Balance

    Menerapkan SMOTE-NC hanya pada data latih di dalam evaluasi.

  4. 04

    Validate

    Menggunakan Stratified 5-Fold Cross Validation.

  5. 05

    Explain

    Membandingkan performa dan kontribusi fitur menggunakan SHAP.

04 · Hasil

Perbandingan lima model dengan prosedur yang sama

Seluruh model dievaluasi pada skenario klasifikasi binary menggunakan Stratified 5-Fold Cross Validation. Penyajian semua model membantu memperlihatkan trade-off performa, bukan hanya menonjolkan satu hasil terbaik.

ModelMetode evaluasiRata-rata akurasi
Gradient BoostingStratified 5-Fold CV85,38%
Random ForestStratified 5-Fold CV81,82%
Regresi LogistikStratified 5-Fold CV79,39%
Decision TreeStratified 5-Fold CV76,24%
Naive BayesStratified 5-Fold CV52,48%

Angka ini merupakan hasil evaluasi internal pada dataset proyek, bukan klaim performa pada populasi baru.

05 · Output

Artefak yang dihasilkan

Dataset siap analisis

Dataset akhir berisi 284.776 observasi dan 152 fitur setelah audit, pembersihan, serta validasi struktur data.

Evaluasi yang dapat dibandingkan

Lima algoritma dinilai dengan pembagian fold dan prosedur evaluasi yang konsisten.

Interpretasi model

Visualisasi metrik dan SHAP disusun untuk membantu pembacaan performa serta kontribusi fitur.

06 · Teknologi

Perangkat kerja

Lanjut menjelajah

Proyek berikutnyaPreeclampsia Research Classifier→