Zurück zur Modulübersicht
13.3Jgst. 13FortgeschrittenWird aufgebaut

Künstliche Intelligenz

Vom künstlichen Neuron über das Training neuronaler Netze bis zum Clustern mit k-Means – mit Simulatoren zum Selbstausprobieren.

4 Stunden LernzeitKI · Maschinelles Lernen · Neuronale Netze

Ihr Fortschritt

Modul-Fortschritt0 %

Lernziele

  • Sie erklären den Aufbau eines künstlichen Neurons und berechnen seine Ausgabe.
  • Sie deuten die Gewichte eines Perzeptrons als Trenngerade.
  • Sie wenden die Lernregel an und erklären, wann das Training nicht terminiert.
  • Sie beschreiben den Aufbau eines neuronalen Netzes und die Forward Propagation.
  • Sie erläutern Kostenfunktion und Gradientenabstieg als Idee der Fehlerrückführung.
  • Sie beschreiben den k-Means-Algorithmus und untersuchen den Einfluss von k.
  • Sie unterscheiden überwachtes, unüberwachtes und bestärkendes Lernen.
  • Sie bewerten Chancen und Risiken maschinellen Lernens.

Schritt 1

Motivation

Was hier gelernt wird – und was nicht.

Maschinelles Lernen ist kein Denken, sondern Rechnen mit Zahlen, die so lange angepasst werden, bis die Ausgaben zu den Beispielen passen. Dieser Lernbereich zeigt beide Grundformen an ihren einfachsten Vertretern: das Perzeptron für das überwachte Lernen und k-Means für das unüberwachte.

Beide sind klein genug, um sie von Hand nachzurechnen – und genau darin liegt ihr Wert. Wer einmal selbst eine gewichtete Summe gebildet und ein Gewicht angepasst hat, weiß, was in einem großen Netz millionenfach passiert.

Schritt 2

Erklärung

Das künstliche Neuron.

Aufbau eines Perzeptrons

Ein künstliches Neuron bekommt mehrere Eingaben, gewichtet sie, summiert und entscheidet anhand eines Schwellenwerts:

z = w₁·x₁ + w₂·x₂ + … + wₙ·xₙ

Ausgabe = 1, falls z ≥ θ
Ausgabe = 0, falls z < θ
BegriffBedeutung
xᵢEingabewerte – die Merkmale eines Datensatzes
wᵢGewichte – wie stark ein Merkmal zählt
zgewichtete Summe
θSchwellenwert – ab wann das Neuron „feuert"

Die Lernregel

Beim Training werden die Gewichte nach jedem falsch eingeordneten Beispiel angepasst:

Fehler d = Soll − Ist
wᵢ  ←  wᵢ + η · d · xᵢ
θ   ←  θ − η · d

Dabei ist η die Lernrate: Sie bestimmt, wie groß ein Anpassungsschritt ist. Kleine Lernrate heißt kleine Schritte, aber mehr davon.

Ist der Fehler 0, ändert sich nichts – ein richtig eingeordnetes Beispiel lässt die Gewichte in Ruhe. Ein vollständiger Durchlauf ohne einzige Anpassung bedeutet: Alle Daten sind richtig getrennt, das Training ist fertig.

Schritt 2

Erklärung

Vom Neuron zum Netz.

Neuronale Netze

Ein Netz besteht aus Schichten:

  • Eingabeschicht – nimmt die Merkmale auf
  • verdeckte Schichten – dazwischen; jede kann weitere Trennlinien beitragen
  • Ausgabeschicht – liefert das Ergebnis

Bei der Forward Propagation wandern die Werte von links nach rechts: Jedes Neuron bildet seine gewichtete Summe aus den Ausgaben der vorigen Schicht, wendet die Aktivierungsfunktion an und gibt das Ergebnis weiter.

Mehrere Neuronen bedeuten mehrere Geraden – und mehrere Geraden begrenzen gemeinsam ein Gebiet. Damit lassen sich Formen trennen, an denen ein einzelnes Perzeptron scheitert.

Kostenfunktion und Gradientenabstieg

Damit ein Netz lernen kann, muss „falsch" zu einer Zahl werden. Das leistet die Kostenfunktion: Sie misst, wie weit die Ausgaben von den Sollwerten entfernt sind – üblich ist die Summe der quadrierten Abweichungen.

Der Gradientenabstieg nutzt diese Zahl als Landschaft: Man bestimmt an der aktuellen Stelle die Richtung des steilsten Abstiegs und geht ein Stück bergab. Die Schrittweite ist wieder die Lernrate.

LernrateFolge
zu kleindas Training dauert sehr lange
passenddie Kosten sinken stetig
zu großdie Schritte springen über das Minimum hinweg

Die Fehlerrückführung (Backpropagation) verteilt den Fehler von der Ausgabe rückwärts auf alle Gewichte – sie beantwortet die Frage, welches Gewicht wie viel Schuld am Fehler trägt.

Schritt 2

Erklärung

Lernen ohne Antworten.

Clustern mit k-Means

Beim unüberwachten Lernen stehen keine Antworten in den Daten. Der k-Means-Algorithmus sucht selbst Gruppen:

  1. k wählen – die Anzahl der Cluster
  2. k Startzentren festlegen
  3. Zuordnen: jeden Punkt dem nächstgelegenen Zentrum zuweisen
  4. Verschieben: jedes Zentrum in den Schwerpunkt seines Clusters legen
  5. Schritte 3 und 4 wiederholen, bis sich nichts mehr ändert

Gerechnet wird meist mit dem quadrierten Abstand – für die Frage „welches Zentrum ist näher?" liefert er dieselbe Antwort wie der euklidische, spart aber die Wurzel.

Grenzen

  • k muss vorher feststehen. Ein falsches k liefert trotzdem ein Ergebnis – nur eben ein sinnloses.
  • Die Startzentren beeinflussen das Ergebnis. Ein Zentrum kann leer ausgehen und sich nie mehr bewegen.
  • k-Means findet runde Cluster. Einen Ring zerschneidet es, statt ihn als eine Gruppe zu erkennen – das Verfahren kennt nur Abstände zu Mittelpunkten.

Drei Arten des Lernens

ArtLeitfrageBeispiel
überwachtDie richtige Antwort steht in den Daten.Bilder mit Beschriftung „Katze"/„Hund"
unüberwachtEs gibt keine Antworten – finde selbst Struktur.Kundengruppen im Marketing
bestärkendEs gibt Belohnung statt Antworten.ein Programm lernt ein Spiel durch Punkte

Schritt 2

Erklärung

Chancen, Risiken, Verantwortung.

Bewerten statt bewundern

Maschinelles Lernen entscheidet inzwischen mit über Kreditvergaben, Bewerbungen, medizinische Befunde und Polizeieinsätze. Für die Bewertung lohnen vier Fragen:

  1. Woher kommen die Trainingsdaten? Ein Modell lernt die Muster seiner Daten – einschließlich der Verzerrungen darin. Sind bestimmte Gruppen unterrepräsentiert, wird das Modell für sie schlechter.
  2. Was passiert bei einem Fehler? Ein falsch erkanntes Musikstück ist etwas anderes als eine falsch abgelehnte Bewerbung.
  3. Ist die Entscheidung nachvollziehbar? Bei großen Netzen lässt sich oft nicht angeben, warum eine Ausgabe so ausfiel.
  4. Wer trägt die Verantwortung? Ein Modell trägt keine – die Verantwortung bleibt bei denen, die es einsetzen.

Schritt 8

Zusammenfassung

Das Wichtigste auf einen Blick.

  • Ein Perzeptron bildet die gewichtete Summe und vergleicht sie mit einem Schwellenwert; seine Gewichte beschreiben eine Trenngerade.
  • Die Lernregel ändert nur bei Fehlern etwas; ein Durchlauf ohne Änderung bedeutet, dass die Daten getrennt sind.
  • Bei nicht linear trennbaren Daten terminiert das Training nicht – dafür braucht es ein Netz.
  • Die Kostenfunktion macht aus „falsch" eine Zahl, der Gradientenabstieg aus der Zahl eine Richtung.
  • k-Means wechselt zwischen Zuordnen und Verschieben, bis sich nichts mehr ändert; k und die Startzentren müssen vorgegeben werden.
  • Überwacht, unüberwacht, bestärkend unterscheiden sich darin, ob die Antwort in den Daten steht, fehlt oder durch Belohnung ersetzt wird.
  • Die Bewertung fragt nach Daten, Fehlerfolgen, Nachvollziehbarkeit und Verantwortung.