Sveriges mest populära poddar
KI verstehen

KI als Sicherheitsrisiko - Wie sich Chatbots mit "Jailbreaks" entfesseln lassen

41 min2 juli 2026
KI-Chatbots sollen immer sicherer werden. Doch fast jedes Sprachmodell lässt sich überreden, Grenzen zu ignorieren, die ihm seine Entwickler gesetzt haben. Das kann unterhaltsam sein - oder brandgefährlich. Die Tech-Journalistin Eva Wolfangel erzählt Moritz von ihren Recherchen und Erfahrungen beim Jailbreaking von Chatbots und ihren Sorgen mit Blick auf KI-Agenten.

Das erwartet Euch in dieser Folge:

(00:00) Warum Jailbreaking nicht nur Nerds interessieren sollte
(05:17) Die inhärenten Schwächen von Sprachmodellen
(11:20) Welche Tricks es gibt, um Chatbots zu manipulieren
(16:15) Wie Anthropics KI "Claude Fable" entfesselt wurde
(21:04) Warum der Hacker "Pliny" KI-Modelle befreien will
(30:22) Bei KI-Agenten sind Jailbreaks brandgefährlich
(36:10) Wie Nutzer KI-Systeme auf die Probe stellen können

Mehr zum Thema in der Deutschlandfunk App:


Weiterführende Links:


Wenn Euch diese Episode gefallen hat, abonniert uns und empfehlt uns gerne weiter. Für Kritik, Fragen und Anregungen aller Art schickt uns eine E-Mail an [email protected].

Noch mehr spannende Podcasts gibt’s in der Deutschlandfunk App.
Folgt dem Deutschlandfunk auch auf Instagram oder Facebook.

KI verstehen med Deutschlandfunk finns tillgänglig på flera plattformar. Informationen på denna sida kommer från offentliga podd-flöden.