Implementasi Conditional Random Field dan T5 untuk Deteksi dan Koreksi Kesalahan Sintaksis Bahasa Indonesia

Angelina Tanuwidjaja, Gisselle (2026) Implementasi Conditional Random Field dan T5 untuk Deteksi dan Koreksi Kesalahan Sintaksis Bahasa Indonesia. Bachelor Thesis, Universitas Multimedia Nusantara.

[img] PDF
HALAMAN_AWAL.pdf
Restricted to Registered users only

Download (1MB)
[img] PDF
BAB_I.pdf

Download (232kB)
[img] PDF
BAB_II.pdf

Download (487kB)
[img] PDF
BAB_III.pdf
Restricted to Registered users only

Download (385kB)
[img] PDF
BAB_IV.pdf
Restricted to Registered users only

Download (1MB)
[img] PDF
BAB_V.pdf
Restricted to Registered users only

Download (213kB)
[img] PDF
DAFTAR_PUSTAKA.pdf
Restricted to Registered users only

Download (229kB)
[img] PDF
LAMPIRAN.pdf
Restricted to Registered users only

Download (344kB)
[img] Archive (ZIP)
00000075514_2521_LembarPengesahan.pdf
Restricted to Registered users only

Download (66kB)

Abstract

Kesalahan sintaksis dapat memengaruhi kejelasan dan ketepatan penyampaian informasi dalam teks berbahasa Indonesia. Proses identifikasi dan perbaikannya secara manual memerlukan waktu serta pemahaman linguistik yang memadai. Penelitian ini bertujuan mengembangkan sistem deteksi dan koreksi kesalahan sintaksis pada teks berita daring berbahasa Indonesia menggunakan kombinasi Conditional Random Fields dan IndoT5. Tahap deteksi dilakukan menggunakan model CRF dengan memanfaatkan fitur token, Part-of-Speech (POS) tagging, dan phrase chunking. Dataset disusun berdasarkan 12 kategori kesalahan sintaksis yang diekstraksi dari 10.000 artikel berita TribunNews dan direpresentasikan menggunakan skema pelabelan BIO. Hasil deteksi kemudian digunakan sebagai masukan bagi model Wikidepia/IndoT5-base untuk menghasilkan kalimat yang telah diperbaiki. Pada tahap koreksi, kalimat masukan diberi penanda kategori kesalahan untuk membantu model memahami jenis kesalahan yang harus diperbaiki. Hasil evaluasi menunjukkan bahwa model CRF mampu mendeteksi kesalahan sintaksis dengan precision sebesar 0,97, recall sebesar 0,95, dan F1-score sebesar 0,96 pada data uji. Selanjutnya, model IndoT5 memperoleh nilai BLEU sebesar 93,25, ROUGE-1 sebesar 0,9709, ROUGE-2 sebesar 0,9617, ROUGE- L sebesar 0,9703, Exact Match sebesar 75,29%, dan Exact Match ternormalisasi sebesar 83,91% pada data uji. Hasil tersebut menunjukkan bahwa kombinasi CRF dan IndoT5 mampu mendeteksi serta mengoreksi kesalahan sintaksis bahasa Indonesia secara efektif, sehingga berpotensi mendukung proses penyuntingan teks berita secara otomatis.

Item Type: Thesis (Bachelor Thesis)
Creators: Angelina Tanuwidjaja, Gisselle (00000075514)
Contributors: Vasty Overbeek, Marlinda
Keywords: Conditional Random Fields,IndoT5, kesalahan sintaksis bahasa Indonesia, Natural Language Processing
Subjects: 000 Computer Science, Information and General Works
Divisions: Faculty of Engineering & Informatics > Informatics
Date Deposited: 22 Jul 2026 08:00
URI: https://kc.umn.ac.id/id/eprint/47858

Actions (login required)

View Item View Item