Soal 2: Probabilitas Kondisional — Klasifikasi Email Spam

Pertanyaan (Level C2)
Dalam sistem klasifikasi email, probabilitas sebuah email adalah spam adalah 0.3. Jika email mengandung kata "hadiah", probabilitasnya menjadi spam naik menjadi 0.8. Jelaskan mengapa informasi berubah setelah mengetahui kata "hadiah" dan formulasikan solusi menggunakan conditional probability dan conditional information.

Jawaban

1. Konsep Dasar

Di teori informasi, conditional information ngukur informasi suatu kejadian dengan syarat kejadian lain udah kita tau. Pas kita dapet info baru (ada kata "hadiah"), ketidakpastian soal status spam langsung berubah — dan ini keliatan dari perubahan probabilitasnya.

Prior Probability

\(P(\text{spam}) = 0.3\)

Tanpa info tambahan, cuma 30% email yang spam. Ini yang namanya prior belief.

Posterior Probability

\(P(\text{spam} \mid \text{"hadiah"}) = 0.8\)

Begitu tau email-nya ada kata "hadiah", probabilitas spam langsung naik ke 80%. Ini posterior belief.

2. Kenapa Informasi Bisa Berubah?

Info berubah gara-gara kata "hadiah" ngasih bukti tambahan (evidence) yang ngurangin ketidakpastian. Singkatnya gini:

  • Sebelum liat "hadiah": self-information spam = \(-\log_2(0.3) \approx 1.737\) bits
  • Sesudah liat "hadiah": conditional self-information = \(-\log_2(0.8) \approx 0.322\) bits
  • Penurunan informasi = \(1.737 - 0.322 = 1.415\) bits — nah ini yang disebut mutual information antara kata "hadiah" sama status spam.
Conditional Self-Information

$$I(x \mid y) = -\log_2 P(x \mid y)$$

3. Rumus Conditional Probability

Pake teorema Bayes:

Teorema Bayes

$$P(\text{spam} \mid \text{"hadiah"}) = \frac{P(\text{"hadiah"} \mid \text{spam}) \cdot P(\text{spam})}{P(\text{"hadiah"})}$$

Dari data yang dikasih:

  • \(P(\text{spam}) = 0.3\) (prior)
  • \(P(\text{spam} \mid \text{"hadiah"}) = 0.8\) (posterior)

Lonjakan dari 0.3 ke 0.8 nunjukin kalo kata "hadiah" itu fitur yang jago banget ngebedain spam dan bukan spam. Dalam teori informasi, artinya kata "hadiah" punya mutual information yang tinggi sama kelas spam.

Perubahan Informasi (Information Gain)

$$\Delta I = I(\text{spam}) - I(\text{spam} \mid \text{"hadiah"})$$ $$\Delta I = -\log_2(0.3) - (-\log_2(0.8))$$ $$\Delta I = \log_2(0.8) - \log_2(0.3) = \log_2\left(\frac{0.8}{0.3}\right)$$ $$\Delta I = \log_2(2.667) \approx 1.415 \text{ bits}$$

4. Intinya Apa?

Jadi, kata "hadiah" ngasih 1.415 bits informasi soal status spam. Artinya ketidakpastian kita turun banyak — tadinya cuma 30% yakin, sekarang jadi 80% yakin kalo email itu spam. Di sistem filter spam beneran, kata-kata yang information gain-nya gede kayak "hadiah", "gratis", "menang" dipake sebagai fitur utama buat klasifikasi.
📢 Diagram perubahan probabilitas: Prior → Posterior Dua batang: prior (0.3) vs posterior (0.8), sama panah information gain-nya

5. Penerapan di Filter Email

  • Naive Bayes Classifier pake conditional probability buat ngitung probabilitas spam berdasarkan banyak kata sekaligus.
  • Information Gain dipake buat milih fitur — nyari kata-kata yang paling jago ngebedain spam sama bukan spam.
  • Kata yang information gain-nya paling gede (kayak "hadiah") jadi indikator kuat di model klasifikasi.