Aufgabe: zur Validierung
- Kopiere die Testdaten (also die restlichen 10 Datensätze) aus deinem Datenset (siehe Datenaufbereitung) in das Arbeitsblatt Validierung.
- Versuche nachzuvollziehen, was mit den eingefügten Datensätzen in den Arbeitsblättern Validierung 1, Validierung 2 und Validierung 3 passiert.
- Wie gross ist die Erfolgsquote des Spamfilters gemäss deinen Testdaten, basierend auf deinen Trainingsdaten?
- Öffne die Registerkarte Anwendung und überlege dir einige Beispielsätze, die du gerne testen möchtest. Gib diese ein (zusammen mit der korrekten Klassifizierung) und überprüfe, wie gut der Spamfilter mit deinen Beispielen funktioniert.
⭐ Zusatzaufgabe: zum KI-Modell
Auszug einiger erstellten Nachrichten der Klasse G28e:
| Label | Nachricht | |
|---|---|---|
| 1 | ham | Kannst du heute bitte unseren Hund füttern? |
| 2 | spam | Abboniere und hol dir jetzt dein Wilkommensgeschenk! |
| 3 | ham | Wollen wir Morgen zusammen in die Stadt? Liebe Grüsse! |
| 4 | spam | Sichere dir jetzt unsere heiss begehrte Herbst-Kollektion und spare bis zu 30%! |
| 5 | ham | Leider bin ich erkältet und komme heute nicht zur Arbeit. LG |
| 6 | spam | Um die Bestellung abzuschliessen klicke auf diesen Link. |
| 7 | spam | Klicke diesen Link und bekomme 40% Rabatt!!! |
| 8 | ham | Liebe Klasse, die Prüfung am 28.7. wird trotzdem stattfinden. Freudliche Grüsse! |
- Nimm die Nachrichten 1 bis 6 als Trainingsdaten. Bestimme basierend auf diesen Trainingsdaten die Spam- und Ham-Wahrscheinlichkeiten für die Worte Hund, Grüsse, spare und Link? Drücke die Wahrscheinlichkeiten als Brüche aus.
Bemerkung 1: Wir zählen Herbst-Kollektion sowie 30% als je ein Wort.
Bemerkung 2: Die Nachrichten 7 und 8 heben wir uns für später als Testdaten auf. - Berechne die A-priori-Wahrscheinlichkeiten basierend auf unseren Trainingsdaten.
- Basierend auf deinen berechneten Wahrscheinlichkeiten berechne die Spam- und Ham-Wahrscheinlichkeit für die Nachricht 7. Drücke alle Wahrscheinlichkeiten als Brüche aus und klassifiziere die Nachricht schlussendlich gemäss deinen Berechnungen.
- Klassifiziere nun noch die Nachricht 8.
- Gestützt auf den Testdaten bestimme nun die Genauigkeit unseres Spam-Filters.
- Nehmen wir an, dass sich leider ein Fehler bei der Datenerfassung eingeschlichen hat und Nachricht 3 versehentlich als Spam gelabelt wurde. Wiederhole die obigen Aufgaben mit diesem Fehler.
- Was ist deine Schlussfolgerung zu diesem Fehler?
- Wieso kann eigentlich eine KI halluzinieren?
Lösung
- Zuerst zählen wir die Wörter:
| Wort | # Spam | # Ham |
|---|---|---|
| Hund | 0 | 1 |
| Grüsse | 0 | 1 |
| spare | 1 | 0 |
| Link | 1 | 0 |
| Gesamt | 27 | 27 |
und nun können wir die Wahrscheinlichkeiten berechnen:
| Wort | p_Spam | p_Ham |
|---|---|---|
| Hund | 0 | 1/27 |
| Grüsse | 0 | 1/27 |
| spare | 1/27 | 0 |
| Link | 1/27 | 0 |
Die gleiche Überlegung führt uns zu . → Spam
Bemerkung: Alle Wörter, die nicht trainiert wurden, haben wir ignoriert. → HamVon insgesamt 2 Testnachrichten wurden 2 richtig bestimmt. → Genauigkeit = 2/2 = 100%
Zuerst zählen wir die Wörter:
| Wort | # Spam | # Ham |
|---|---|---|
| Hund | 0 | 1 |
| Grüsse | 1 | 0 |
| spare | 1 | 0 |
| Link | 1 | 0 |
| Gesamt | 36 | 18 |
und nun können wir die Wahrscheinlichkeiten berechnen:
| Wort | p_Spam | p_Ham |
|---|---|---|
| Hund | 0 | 1/18 |
| Grüsse | 1/36 | 0 |
| spare | 1/36 | 0 |
| Link | 1/36 | 0 |
Die gleiche Überlegung führt uns zu
Von insgesamt 2 Testnachrichten wurde 1 richtig bestimmt. → Genauigkeit = 1/2 = 50%
Die Datenqualität ist entscheidend für den Erfolg und die Aussagekraft von KI-Systemen.
Wir haben gesehen, dass heutige KIs auf Basis statistischer Modelle arbeiten und kein Verständnis ihrer Inhalte haben. Sie können also ihren Output nicht prüfen. Dies bleibt die Aufgabe von uns!
Wenn die KI mit fehlerhaften, verzerrten oder unvollständigen Daten trainiert wurde oder wenn ein falsches Modell angewandt wurde, kann dies zu sogenannten Halluzinationen führen.