TagesseminarKI-Grundlagen, Strategie & Technologie
Alignment und Interpretierbarkeit von KI: wie man in neuronale Netze hineinschaut
Ganztägiges Seminar, das ein KI-Thema fundiert und praxisnah vermittelt.
Alignment und Interpretierbarkeit von KI: wie man in neuronale Netze hineinschaut.
MODUL 01: WARUM INTERPRETIERBARKEIT?
- Das Blackbox-Problem und Vertrauen
- Interpretierbarkeit versus Erklärbarkeit
- Anwendungsfelder
- Live-Demo: warum ein Modell so entscheidet
- Ihre Ausgangslage: Wie viel vertrauen Sie Ihren Modellen?
MODUL 02: METHODEN
- Feature-Attribution (SHAP, Integrated Gradients)
- Probing und Aktivierungsanalyse
- Übung: Sie interpretieren ein Modell
- Der Aha-Moment: der wahre Grund hinter der Vorhersage
- Grenzen der Methoden
MODUL 03: MECHANISTIC INTERPRETABILITY
- Schaltkreise und Features in Netzen
- Was aktuelle Forschung findet
- Übung: Sie erkunden Aktivierungen
- Ins Innere des Netzes schauen
- Was heute möglich ist – und was nicht
MODUL 04: ALIGNMENT
- Was Alignment bedeutet
- RLHF und Constitutional-Ansätze
- Diskussion: Kontrolle und Sicherheit
- Der Aha-Moment: Modelle hilfreich und harmlos machen
- Warum Alignment über Erfolg entscheidet
MODUL 05: PRAXIS
- Interpretierbarkeit im eigenen Projekt einsetzen
- Fallstudie: eine Modellentscheidung erklären
- Vertrauen und Compliance stärken
- Vom Konzept zur Anwendung
- Ihr Fahrplan zu erklärbarer KI