TagesseminarKI-Grundlagen, Strategie & Technologie

Alignment und Interpretierbarkeit von KI: wie man in neuronale Netze hineinschaut

Ganztägiges Seminar, das ein KI-Thema fundiert und praxisnah vermittelt.

Alignment und Interpretierbarkeit von KI: wie man in neuronale Netze hineinschaut.

MODUL 01: WARUM INTERPRETIERBARKEIT?

  • Das Blackbox-Problem und Vertrauen
  • Interpretierbarkeit versus Erklärbarkeit
  • Anwendungsfelder
  • Live-Demo: warum ein Modell so entscheidet
  • Ihre Ausgangslage: Wie viel vertrauen Sie Ihren Modellen?

MODUL 02: METHODEN

  • Feature-Attribution (SHAP, Integrated Gradients)
  • Probing und Aktivierungsanalyse
  • Übung: Sie interpretieren ein Modell
  • Der Aha-Moment: der wahre Grund hinter der Vorhersage
  • Grenzen der Methoden

MODUL 03: MECHANISTIC INTERPRETABILITY

  • Schaltkreise und Features in Netzen
  • Was aktuelle Forschung findet
  • Übung: Sie erkunden Aktivierungen
  • Ins Innere des Netzes schauen
  • Was heute möglich ist – und was nicht

MODUL 04: ALIGNMENT

  • Was Alignment bedeutet
  • RLHF und Constitutional-Ansätze
  • Diskussion: Kontrolle und Sicherheit
  • Der Aha-Moment: Modelle hilfreich und harmlos machen
  • Warum Alignment über Erfolg entscheidet

MODUL 05: PRAXIS

  • Interpretierbarkeit im eigenen Projekt einsetzen
  • Fallstudie: eine Modellentscheidung erklären
  • Vertrauen und Compliance stärken
  • Vom Konzept zur Anwendung
  • Ihr Fahrplan zu erklärbarer KI