Abstrak


Perbandingan Model Sbert Multilingual Dengan Pendekatan Hybrid Scoring Untuk Penilaian Jawaban Esai Otomatis Bahasa Indonesia


Oleh :
Lintang Mukti Nugroho - K3522040 - Fak. KIP

Penelitian ini bertujuan untuk (1) membandingkan kinerja tiga varian model SBERT multilingual, yaitu distiluse-base-multilingual-cased-v2, paraphrase-multilingual-mpnet-base-v2, dan XLM-RoBERTa-base dengan pendekatan Hybrid Scoring, (2) menentukan nilai Alpha (α) optimal pada formula Hybrid Scoring melalui simulasi grid search, serta (3) mengevaluasi konsistensi sistem penilaian otomatis terhadap variasi jawaban siswa. Penelitian menggunakan desain eksperimen komputasi dengan dataset 4.550 pasangan jawaban siswa dari 7 butir soal multidisiplin (Sriyanto & Kusrini, 2025). Label dikonversi dari biner menjadi skor kontinu menggunakan rubrik yang dikembangkan peneliti, dengan validitas ground truth dikonfirmasi melalui Cohen's Kappa sebesar 0,729 (substantial agreement). Eksperimen dilakukan dengan domain-specific fine-tuning menggunakan fungsi objektif Cosine Similarity Loss dan divalidasi melalui 5-Fold Cross-Validation, dengan metrik regresi (MAE, RMSE, R²) sebagai pengukuran utama dan metrik klasifikasi sebagai pelengkap. Hasil penelitian menunjukkan bahwa distiluse-base-multilingual-cased-v2 merupakan model terbaik dengan MAE terendah 3,128, Accuracy 90,48%, F1-Score 0,909, serta CV MAE 1,651 dan CV R² 0,968. Nilai Alpha optimal ketiga model konsisten berada pada α = 1,0, membuktikan komponen semantik SBERT sudah mampu merepresentasikan pola penilaian guru tanpa bobot leksikal dari Jaccard Similarity. Sistem juga menunjukkan konsistensi tinggi dengan standar deviasi CV MAE kecil pada distiluse (±0,137) dan paraphrase (±0,104). Disimpulkan bahwa distiluse-base-multilingual-cased-v2 dengan α = 1,0 merupakan konfigurasi paling optimal untuk penilaian esai otomatis Bahasa Indonesia. Penelitian selanjutnya disarankan untuk menguji sistem pada dataset dengan cakupan mata pelajaran dan jenjang pendidikan yang lebih luas, serta mengeksplorasi model berbahasa Indonesia terlatih seperti IndoBERT sebagai pembanding.