Soal 4: Mutual Information & Relative Entropy — Sistem Rekomendasi
Jawaban
Bagian A: Mutual Information \(I(X; Y)\)
1. Kenapa Pake Mutual Information?
Mutual Information (MI) ngukur seberapa banyak informasi yang dishare antara dua variabel random X dan Y. Di sistem rekomendasi:
- X = Minat pengguna ke kategori film (misal: Action, Drama, Comedy)
- Y = Film yang akhirnya diklik pengguna
Mutual information cocok dipake karena:
1. Ngukur Ketergantungan
MI ngukur seberapa kuat hubungan antara minat (X) sama perilaku klik (Y). MI = 0 artinya independen (minat ga ngaruh ke klik), MI > 0 artinya ada hubungan.
2. Feature Selection
MI bisa dipake buat milih fitur yang paling relevan — kategori film mana yang paling nyambung sama klik beneran pengguna.
3. Hubungan Non-linear
Beda sama korelasi Pearson yang cuma nangkep relasi linear, MI bisa nangkep hubungan non-linear antara minat sama klik.
4. Ngurangin Ketidakpastian
MI ngukur seberapa gede ketidakpastian soal klik (Y) berkurang setelah kita tau minat pengguna (X), atau sebaliknya.
2. Rumus Mutual Information
$$I(X; Y) = H(X) - H(X \mid Y)$$ $$I(X; Y) = H(Y) - H(Y \mid X)$$
MI itu pengurangan entropy (ketidakpastian) dari satu variabel setelah kita tau variabel yang lain.
$$I(X; Y) = \sum_{x \in X} \sum_{y \in Y} P(x, y) \cdot \log_2\left(\frac{P(x, y)}{P(x) \cdot P(y)}\right)$$
Dimana \(P(x,y)\) = joint probability, \(P(x)\) sama \(P(y)\) = marginal probabilities.
$$I(X; Y) = H(X) + H(Y) - H(X, Y)$$
3. Sifat-sifat Mutual Information
- Simetris: \(I(X; Y) = I(Y; X)\) — informasi yang dishare sifatnya dua arah.
- Non-negatif: \(I(X; Y) \geq 0\) — selalu \(\geq 0\), nol cuma kalo X dan Y independen.
- Terbatas: \(I(X; Y) \leq \min(H(X), H(Y))\) — MI ga bisa lebih gede dari entropy masing-masing variabel.
4. Contoh di Sistem Rekomendasi
Misal di dataset:
- \(P(\text{Action}) = 0.4\), \(P(\text{Drama}) = 0.35\), \(P(\text{Comedy}) = 0.25\)
- Joint distribution \(P(X, Y)\) nunjukin probabilitas pengguna dengan minat X ngeklik film Y.
Kalo \(I(X; Y)\) tinggi → rekomendasi berdasarkan minat pengguna bakal efektif soalnya minat beneran nyambung sama klik.
Kalo \(I(X; Y) \approx 0\) → sistem rekomendasi harus nyari fitur lain, soalnya minat ga ada hubungannya sama perilaku klik.
Bagian B: Relative Entropy (KL Divergence)
1. Definisi
Relative Entropy atau Kullback-Leibler (KL) Divergence ngukur seberapa beda dua distribusi probabilitas P dan Q. KL divergence ngukur berapa banyak informasi yang ilang kalo kita pake distribusi Q buat ngira-ngira distribusi P yang sebenernya.
$$D_{KL}(P \parallel Q) = \sum_{x \in X} P(x) \cdot \log_2\left(\frac{P(x)}{Q(x)}\right)$$
Dimana P = distribusi sebenernya, Q = distribusi perkiraan/model.
2. Kapan Pake Relative Entropy?
1. Evaluasi Model
Ngecek seberapa bagus model prediksi (Q) ngedeketin distribusi asli (P). Makin kecil \(D_{KL}\), makin oke modelnya.
2. Training Sistem Rekomendasi
Dipake sebagai loss function: ngeminimalin KL divergence antara distribusi prediksi model sama distribusi preferensi beneran pengguna.
3. Deteksi Drift
Ngendusin perubahan perilaku pengguna: kalo \(D_{KL}(P_{\text{old}} \parallel P_{\text{new}})\) gede → terjadi concept drift, model harus di-retrain.
4. A/B Testing
Ngebandingin distribusi klik antara dua grup pengguna (control vs treatment) buat ngukur efek dari perubahan UI/algoritma.
3. Sifat Penting KL Divergence
- Ga simetris: \(D_{KL}(P \parallel Q) \neq D_{KL}(Q \parallel P)\) — bukan metrik jarak beneran.
- Non-negatif: \(D_{KL}(P \parallel Q) \geq 0\) (Gibbs' inequality), sama dengan 0 cuma kalo P = Q.
- Hubungan sama MI: \(I(X; Y) = D_{KL}(P(X,Y) \parallel P(X) \cdot P(Y))\) — Mutual Information itu KL divergence antara joint distribution sama product of marginals.