Abstrak


ANALISIS SENTIMEN BERBASIS ASPEK PADA ULASAN WISATAWAN MENGGUNAKAN MODEL INDOBERTWEET


Oleh :
Bintang Harida Ramadhan - L0122034 - Fak. Teknologi Informasi dan Sains Data

Solo Safari Zoo adalah destinasi wisata alam di Surakarta yang ulasan Google Maps-nya mencerminkan pola bahasa informal dan singkatan yang menyulitkan analisis sentimen. Studi ABSA yang ada mengenai ulasan pariwisata berbahasa Indonesia sebagian besar mengandalkan asumsi bahasa formal, model tanpa pralatih, dan sumber anotasi tunggal, sehingga meninggalkan kesenjangan dalam penanganan teks dan penilaian keandalan label. Penelitian ini mengembangkan sistem ABSA pada enam aspek, yaitu atraksi, fasilitas, aksesibilitas, citra, harga, dan sumber daya manusia, menggunakan skema multi-anotator (anotator manusia dan OpenAI) yang menghasilkan tiga varian dataset (Anotator Manusia, OpenAI, dan Interseksi) untuk membandingkan perilaku anotasi dan dampak terhadap performa model. Dataset terdiri dari 5.052 ulasan Google Maps (Januari 2023–September 2025); pada label OpenAI, Atraksi merupakan aspek yang paling seimbang (Positif: 2.167; Negatif: 1.664; Tidak Disebutkan: 1.221), sementara Aksesibilitas dan Citra adalah yang paling tidak seimbang dengan proporsi Tidak Disebutkan melebihi 86% dari total sampel. Klasifikasi sentimen menggunakan IndoBERTweet dan IndoBERT dalam tiga konfigurasi, dievaluasi melalui validasi walk-forward time-series cross-validation untuk menjaga urutan kronologis data ulasan pada 10 fold kuartal. IndoBERTweet dengan Class Weight merupakan konfigurasi dengan performa terbaik dengan rata-rata F1 sebesar 78,0%, dengan semua enam aspek berkorelasi positif terhadap rating bintang pengunjung (Anotator Manusia: ρ = +0,688; OpenAI: ρ = +0,706). Temuan ini menetapkan IndoBERTweet dengan Class Weight sebagai pendekatan yang andal untuk ABSA pada ulasan pariwisata Indonesia informal, sementara kerangka multi-anotator berkontribusi pada metodologi sistematis untuk mengkuantifikasi keandalan anotasi dalam pengaturan sumber daya rendah, sekaligus memajukan pengembangan dataset analisis sentimen untuk bahasa-bahasa yang kurang terwakili dalam ilmu informasi.