Lawrence, Jackson (2026) Implementasi Model BLOOM-560M Berbasis Multi-Task Learning untuk Deteksi dan Identifikasi Span Ujaran Kebencian pada Teks Campuran Bahasa Indonesia-Inggris. Bachelor Thesis, Universitas Multimedia Nusantara.
|
PDF
HALAMAN_AWAL.pdf Restricted to Registered users only Download (1MB) |
|
|
PDF
BAB_I.pdf Download (226kB) |
|
|
PDF
BAB_II.pdf Download (402kB) |
|
|
PDF
BAB_III.pdf Restricted to Registered users only Download (33MB) |
|
|
PDF
BAB_IV.pdf Restricted to Registered users only Download (3MB) |
|
|
PDF
BAB_V.pdf Restricted to Registered users only Download (208kB) |
|
|
PDF
DAFTAR_PUSTAKA.pdf Restricted to Registered users only Download (243kB) |
|
|
PDF
LAMPIRAN.pdf Restricted to Registered users only Download (1MB) |
|
|
Archive (ZIP)
00000070612_2521_LembarPengesahan.pdf Restricted to Registered users only Download (66kB) |
Abstract
Pertumbuhan masif media sosial di Indonesia, dengan lebih dari 160 juta pengguna aktif menurut laporan We Are Social 2024, telah menjadikan ruang digital sebagai ekosistem informasi yang berpengaruh sekaligus rawan penyalahgunaan. Kementerian Komunikasi dan Informatika mencatat hampir 1,4 juta konten negatif di media sosial dengan ujaran kebencian sebagai kategori dominan, yang kini semakin sulit dideteksi akibat maraknya teks code-mixed bahasa Indonesia-Inggris yang mengandung kata slang dan singkatan tidak baku. Penelitian sebelumnya umumnya terbatas pada teks formal atau semi-formal dan hanya menghasilkan klasifikasi tingkat kalimat tanpa mengidentifikasi span penyebab ujaran kebencian secara eksplisit, serta tidak mengandung unsur kata slang maupun singkatan tidak baku. Penelitian ini mengusulkan pipeline terintegrasi berbasis BLOOM-560M dengan Multi-Task Learning untuk mendeteksi ujaran kebencian di tingkat kalimat dan mengidentifikasi hate span di tingkat token secara simultan dalam satu sesi pelatihan. Dataset dibangun dari 40.000 sampel dengan komposisi 30:30:40 (bahasa Indonesia, Inggris, dan code-mixed Indonesia-Inggris) melalui multi-dimensional stratified sampling. Label BIO untuk token toksik dihasilkan secara otomatis melalui weak supervision berbasis TF-IDF Differential Lexicon yang dikonstruksi dari dataset sendiri tanpa anotasi manual, menghasilkan 736 entri leksikon yang terdiri dari 506 unigram dan 230 bigram. Optimasi hyperparameter menggunakan kerangka kerja Optuna dengan harmonic mean dari F1-score dan Span-F1 sebagai fungsi objektif selama 15 trial. Evaluasi pada test set menunjukkan model utama mencapai F1-score sebesar 0,9024 dengan akurasi sebesar 0,9012 dan Span-F1 sebesar 0,7745 dengan Harmonic Mean 0,8336. Evaluasi per ragam bahasa mengkonfirmasi F1-score tertinggi pada teks code-mixed (0,9927), diikuti F1-score bahasa Indonesia (0,8528) dan F1-score bahasa Inggris (0,8291).
| Item Type: | Thesis (Bachelor Thesis) |
|---|---|
| Creators: | Lawrence, Jackson (00000070612) |
| Contributors: | Endariahna Surbakti, Eunike |
| Keywords: | BLOOM-560M, Code-Mixing Indonesia-Inggris, Deteksi Ujaran Kebencian, Identifikasi Hate Span, Multi-Task Learning |
| Subjects: | 000 Computer Science, Information and General Works |
| Divisions: | Faculty of Engineering & Informatics > Informatics |
| Date Deposited: | 25 Jul 2026 08:00 |
| URI: | https://kc.umn.ac.id/id/eprint/48128 |
Actions (login required)
![]() |
View Item |
