Brian Dava, Fidel (2026) Peringkas Konten Video Live Streaming Menggunakan Multimodal Deep Learning untuk Deteksi Momen Penting. Bachelor Thesis, Universitas Multimedia Nusantara.
|
PDF
HALAMAN_AWAL.pdf Restricted to Registered users only Download (3MB) |
|
|
PDF
BAB_I.pdf Download (219kB) |
|
|
PDF
BAB_II.pdf Download (332kB) |
|
|
PDF
BAB_III.pdf Restricted to Registered users only Download (404kB) |
|
|
PDF
BAB_IV.pdf Restricted to Registered users only Download (2MB) |
|
|
PDF
BAB_V.pdf Restricted to Registered users only Download (221kB) |
|
|
PDF
DAFTAR_PUSTAKA.pdf Restricted to Registered users only Download (212kB) |
|
|
PDF
LAMPIRAN.pdf Restricted to Registered users only Download (1MB) |
|
|
Archive (ZIP)
00000073866_2521_LembarPengesahan.pdf Restricted to Registered users only Download (66kB) |
Abstract
Durasi siaran langsung (live streaming) yang panjang memicu kebutuhan peringkasan video (clipping) otomatis, sebab pencarian momen penting secara manual membutuhkan waktu lama dan pendekatan visual murni kurang efektif pada siaran kamera statis. Penelitian ini mengembangkan sistem peringkas video siaran langsung otomatis berbasis Multimodal Deep Learning. Sistem mengadopsi model pre-trained fusi Mosu (TripleSumm) berbasis cross-attention untuk menyinergikan tiga modalitas: fitur visual statis via CLIP (ViT-L/14), fitur akustik via Audio Spectrogram Transformer (AST), dan fitur teks obrolan (live chat) penonton berbasis fine-tuned IndoBERT-base-p2. Dataset dikumpulkan dari 70 video siaran langsung YouTube Indonesia yang dilabeli secara weakly-supervised mengombinasikan sinyal proksi Local Rolling Z-Score dan YouTube Heatmap. Evaluasi dilakukan menggunakan skema cross-video split (GroupShuffleSplit) untuk mengeliminasi bias kebocoran data temporal. Pengujian kuantitatif menunjukkan model fusi multimodal mencapai akurasi keseluruhan sebesar 0,7559. Untuk kelas spesifik Highlight, model memperoleh nilai precision sebesar 0,3639, recall sebesar 0,5259, dan F1-score sebesar 0,4302 pada epoch terbaik 30. Hasil empiris ini membuktikan bahwa integrasi visual dan audio efektif menyaring kebisingan obrolan biasa dengan menekan alarm palsu (False Positive) sebesar 65,4% dibandingkan model modalitas tunggal teks-saja. Integrasi multimodal dan adaptasi bahasa gaul (slang) lokal terbukti berhasil mengotomatisasi seluruh alur pemotongan video (clipping) secara end-to-end melalui pipeline inferensi berbasis CLI dan FFmpeg.
| Item Type: | Thesis (Bachelor Thesis) |
|---|---|
| Creators: | Brian Dava, Fidel (00000073866) |
| Contributors: | Suryadibrata, Alethea (0322099201) |
| Keywords: | clipping, IndoBERT, live streaming, multimodal deep learning, peringkas video. |
| Subjects: | 000 Computer Science, Information and General Works |
| Divisions: | Faculty of Engineering & Informatics > Informatics |
| Date Deposited: | 28 Jul 2026 12:12 |
| URI: | https://kc.umn.ac.id/id/eprint/48401 |
Actions (login required)
![]() |
View Item |
