Soal 2: Probabilitas Kondisional — Klasifikasi Email Spam
Jawaban
1. Konsep Dasar
Di teori informasi, conditional information ngukur informasi suatu kejadian dengan syarat kejadian lain udah kita tau. Pas kita dapet info baru (ada kata "hadiah"), ketidakpastian soal status spam langsung berubah — dan ini keliatan dari perubahan probabilitasnya.
Prior Probability
\(P(\text{spam}) = 0.3\)
Tanpa info tambahan, cuma 30% email yang spam. Ini yang namanya prior belief.
Posterior Probability
\(P(\text{spam} \mid \text{"hadiah"}) = 0.8\)
Begitu tau email-nya ada kata "hadiah", probabilitas spam langsung naik ke 80%. Ini posterior belief.
2. Kenapa Informasi Bisa Berubah?
Info berubah gara-gara kata "hadiah" ngasih bukti tambahan (evidence) yang ngurangin ketidakpastian. Singkatnya gini:
- Sebelum liat "hadiah": self-information spam = \(-\log_2(0.3) \approx 1.737\) bits
- Sesudah liat "hadiah": conditional self-information = \(-\log_2(0.8) \approx 0.322\) bits
- Penurunan informasi = \(1.737 - 0.322 = 1.415\) bits — nah ini yang disebut mutual information antara kata "hadiah" sama status spam.
$$I(x \mid y) = -\log_2 P(x \mid y)$$
3. Rumus Conditional Probability
Pake teorema Bayes:
$$P(\text{spam} \mid \text{"hadiah"}) = \frac{P(\text{"hadiah"} \mid \text{spam}) \cdot P(\text{spam})}{P(\text{"hadiah"})}$$
Dari data yang dikasih:
- \(P(\text{spam}) = 0.3\) (prior)
- \(P(\text{spam} \mid \text{"hadiah"}) = 0.8\) (posterior)
Lonjakan dari 0.3 ke 0.8 nunjukin kalo kata "hadiah" itu fitur yang jago banget ngebedain spam dan bukan spam. Dalam teori informasi, artinya kata "hadiah" punya mutual information yang tinggi sama kelas spam.
$$\Delta I = I(\text{spam}) - I(\text{spam} \mid \text{"hadiah"})$$ $$\Delta I = -\log_2(0.3) - (-\log_2(0.8))$$ $$\Delta I = \log_2(0.8) - \log_2(0.3) = \log_2\left(\frac{0.8}{0.3}\right)$$ $$\Delta I = \log_2(2.667) \approx 1.415 \text{ bits}$$
4. Intinya Apa?
5. Penerapan di Filter Email
- Naive Bayes Classifier pake conditional probability buat ngitung probabilitas spam berdasarkan banyak kata sekaligus.
- Information Gain dipake buat milih fitur — nyari kata-kata yang paling jago ngebedain spam sama bukan spam.
- Kata yang information gain-nya paling gede (kayak "hadiah") jadi indikator kuat di model klasifikasi.