Peringkas Konten Video Live Streaming Menggunakan Multimodal Deep Learning untuk Deteksi Momen Penting

Brian Dava, Fidel (2026) Peringkas Konten Video Live Streaming Menggunakan Multimodal Deep Learning untuk Deteksi Momen Penting. Bachelor Thesis, Universitas Multimedia Nusantara.

[img] PDF
HALAMAN_AWAL.pdf
Restricted to Registered users only

Download (3MB)
[img] PDF
BAB_I.pdf

Download (219kB)
[img] PDF
BAB_II.pdf

Download (332kB)
[img] PDF
BAB_III.pdf
Restricted to Registered users only

Download (404kB)
[img] PDF
BAB_IV.pdf
Restricted to Registered users only

Download (2MB)
[img] PDF
BAB_V.pdf
Restricted to Registered users only

Download (221kB)
[img] PDF
DAFTAR_PUSTAKA.pdf
Restricted to Registered users only

Download (212kB)
[img] PDF
LAMPIRAN.pdf
Restricted to Registered users only

Download (1MB)
[img] Archive (ZIP)
00000073866_2521_LembarPengesahan.pdf
Restricted to Registered users only

Download (66kB)

Abstract

Durasi siaran langsung (live streaming) yang panjang memicu kebutuhan peringkasan video (clipping) otomatis, sebab pencarian momen penting secara manual membutuhkan waktu lama dan pendekatan visual murni kurang efektif pada siaran kamera statis. Penelitian ini mengembangkan sistem peringkas video siaran langsung otomatis berbasis Multimodal Deep Learning. Sistem mengadopsi model pre-trained fusi Mosu (TripleSumm) berbasis cross-attention untuk menyinergikan tiga modalitas: fitur visual statis via CLIP (ViT-L/14), fitur akustik via Audio Spectrogram Transformer (AST), dan fitur teks obrolan (live chat) penonton berbasis fine-tuned IndoBERT-base-p2. Dataset dikumpulkan dari 70 video siaran langsung YouTube Indonesia yang dilabeli secara weakly-supervised mengombinasikan sinyal proksi Local Rolling Z-Score dan YouTube Heatmap. Evaluasi dilakukan menggunakan skema cross-video split (GroupShuffleSplit) untuk mengeliminasi bias kebocoran data temporal. Pengujian kuantitatif menunjukkan model fusi multimodal mencapai akurasi keseluruhan sebesar 0,7559. Untuk kelas spesifik Highlight, model memperoleh nilai precision sebesar 0,3639, recall sebesar 0,5259, dan F1-score sebesar 0,4302 pada epoch terbaik 30. Hasil empiris ini membuktikan bahwa integrasi visual dan audio efektif menyaring kebisingan obrolan biasa dengan menekan alarm palsu (False Positive) sebesar 65,4% dibandingkan model modalitas tunggal teks-saja. Integrasi multimodal dan adaptasi bahasa gaul (slang) lokal terbukti berhasil mengotomatisasi seluruh alur pemotongan video (clipping) secara end-to-end melalui pipeline inferensi berbasis CLI dan FFmpeg.

Item Type: Thesis (Bachelor Thesis)
Creators: Brian Dava, Fidel (00000073866)
Contributors: Suryadibrata, Alethea (0322099201)
Keywords: clipping, IndoBERT, live streaming, multimodal deep learning, peringkas video.
Subjects: 000 Computer Science, Information and General Works
Divisions: Faculty of Engineering & Informatics > Informatics
Date Deposited: 28 Jul 2026 12:12
URI: https://kc.umn.ac.id/id/eprint/48401

Actions (login required)

View Item View Item