Data Science · Natural Language Processing · Public Policy Analytics · 2026
Circular Aspiration Architecture, Pipeline Monitoring Isu Pendidikan dari Media Sosial
Prototipe pipeline data untuk mengumpulkan, memverifikasi, dan menganalisis aspirasi publik soal akses pendidikan di Jakarta dan Banten dari media sosial. Data Twitter diproses lewat verifikasi berbasis aturan, analisis sentimen dengan IndoBERT, dan pemodelan topik LDA, lalu dibobot ulang agar tidak didominasi akun tertentu.
- 3 kelasAnalisis sentimenPositif, netral, dan negatif
- 2 wilayahCakupan geografisJakarta dan Banten
- 1 platformSumber prototipeTwitter sebagai batas studi
Isi studi kasus
Tujuan
Menunjukkan bagaimana percakapan publik di media sosial bisa dikumpulkan, diverifikasi, dan diolah secara transparan untuk memantau isu akses pendidikan, tanpa mengklaim mewakili seluruh populasi.
Hasil dan keterbatasan
Menghasilkan pipeline yang bisa memisahkan data relevan dari noise, mengukur sentimen dan topik utama diskusi pendidikan, serta melaporkan tingkat ketidakpastian dan bias representasi secara eksplisit. Keterbatasan, ini murni prototipe untuk keperluan esai dan demonstrasi, hanya mencakup satu platform, dan hasilnya tidak boleh dibaca sebagai opini populasi tanpa validasi skala besar dan data offline.
Detail teknis
Buka detail implementasi
Peran dan kontribusi
Merancang dan membangun seluruh pipeline sendiri, dari scraping data, verifikasi berbasis aturan, analisis sentimen, pemodelan topik, pembobotan representasi, sampai dashboard Streamlit.
Metodologi
Mengumpulkan tweet publik dengan kata kunci pendidikan menggunakan Apify. Memverifikasi data lewat klasifikasi berbasis aturan untuk memisahkan akun warga, komunitas, media, dan institusi. Melakukan analisis sentimen tiga kelas dengan IndoBERT, dilengkapi audit ketidakpastian dan validasi manual. Menjalankan pemodelan topik LDA dengan evaluasi koherensi, lalu membobot ulang hasil agar representasi lebih seimbang, dan menampilkan semuanya lewat dashboard interaktif.
Teknologi
- Python
- Apify
- IndoBERT
- LDA
- Streamlit
- Pandas
- Jupyter Notebook