Angelina Tanuwidjaja, Gisselle (2026) Implementasi Conditional Random Field dan T5 untuk Deteksi dan Koreksi Kesalahan Sintaksis Bahasa Indonesia. Bachelor Thesis, Universitas Multimedia Nusantara.
|
PDF
HALAMAN_AWAL.pdf Restricted to Registered users only Download (1MB) |
|
|
PDF
BAB_I.pdf Download (232kB) |
|
|
PDF
BAB_II.pdf Download (487kB) |
|
|
PDF
BAB_III.pdf Restricted to Registered users only Download (385kB) |
|
|
PDF
BAB_IV.pdf Restricted to Registered users only Download (1MB) |
|
|
PDF
BAB_V.pdf Restricted to Registered users only Download (213kB) |
|
|
PDF
DAFTAR_PUSTAKA.pdf Restricted to Registered users only Download (229kB) |
|
|
PDF
LAMPIRAN.pdf Restricted to Registered users only Download (344kB) |
|
|
Archive (ZIP)
00000075514_2521_LembarPengesahan.pdf Restricted to Registered users only Download (66kB) |
Abstract
Kesalahan sintaksis dapat memengaruhi kejelasan dan ketepatan penyampaian informasi dalam teks berbahasa Indonesia. Proses identifikasi dan perbaikannya secara manual memerlukan waktu serta pemahaman linguistik yang memadai. Penelitian ini bertujuan mengembangkan sistem deteksi dan koreksi kesalahan sintaksis pada teks berita daring berbahasa Indonesia menggunakan kombinasi Conditional Random Fields dan IndoT5. Tahap deteksi dilakukan menggunakan model CRF dengan memanfaatkan fitur token, Part-of-Speech (POS) tagging, dan phrase chunking. Dataset disusun berdasarkan 12 kategori kesalahan sintaksis yang diekstraksi dari 10.000 artikel berita TribunNews dan direpresentasikan menggunakan skema pelabelan BIO. Hasil deteksi kemudian digunakan sebagai masukan bagi model Wikidepia/IndoT5-base untuk menghasilkan kalimat yang telah diperbaiki. Pada tahap koreksi, kalimat masukan diberi penanda kategori kesalahan untuk membantu model memahami jenis kesalahan yang harus diperbaiki. Hasil evaluasi menunjukkan bahwa model CRF mampu mendeteksi kesalahan sintaksis dengan precision sebesar 0,97, recall sebesar 0,95, dan F1-score sebesar 0,96 pada data uji. Selanjutnya, model IndoT5 memperoleh nilai BLEU sebesar 93,25, ROUGE-1 sebesar 0,9709, ROUGE-2 sebesar 0,9617, ROUGE- L sebesar 0,9703, Exact Match sebesar 75,29%, dan Exact Match ternormalisasi sebesar 83,91% pada data uji. Hasil tersebut menunjukkan bahwa kombinasi CRF dan IndoT5 mampu mendeteksi serta mengoreksi kesalahan sintaksis bahasa Indonesia secara efektif, sehingga berpotensi mendukung proses penyuntingan teks berita secara otomatis.
| Item Type: | Thesis (Bachelor Thesis) |
|---|---|
| Creators: | Angelina Tanuwidjaja, Gisselle (00000075514) |
| Contributors: | Vasty Overbeek, Marlinda |
| Keywords: | Conditional Random Fields,IndoT5, kesalahan sintaksis bahasa Indonesia, Natural Language Processing |
| Subjects: | 000 Computer Science, Information and General Works |
| Divisions: | Faculty of Engineering & Informatics > Informatics |
| Date Deposited: | 22 Jul 2026 08:00 |
| URI: | https://kc.umn.ac.id/id/eprint/47858 |
Actions (login required)
![]() |
View Item |
