Link zum Beitrag

Chatbots bei Psychosen: schlechte Ratgeber oder schnelle Hilfe?

Bei Anfragen mit psychotischem Inhalt liefern Chatbots zu häufig problematische oder nur teilweise angemessene Antworten, so die Ergebnisse einer aktuellen Analyse.

Niederschwellige Anlaufstelle

Der Leidensdruck ist hoch, der Weg zum Therapieplatz steinig und lang: Bei psychischen Erkrankungen fühlen sich Betroffene oft hilflos und unverstanden. In einer akuten Phase kann der Griff zum Smartphone und die Konversation mit einem Chatbot als schnelle Hilfe erscheinen. Dass hier jedoch Vorsicht geboten ist, zeigen die Ergebnisse einer aktuellen Auswertung von Antworten auf psychosebedingte Prompts anhand von drei verschiedenen Chatbots.

Auswertung mit drei Modellen

In der Auswertung wurden drei Versionen von ChatGPT getestet: GPT-5 Auto, GPT-4o sowie die kostenlose Version von ChatGPT. Eingeschlossen wurden 79 Prompts mit psychotischem Inhalt der folgenden fünf Kategorien: ungewöhnliche Gedankeninhalte, Misstrauen, Größenwahn, Wahrnehmungsstörungen und nicht zusammenhängende Äußerungen. Für jeden Prompt gab es einen Kontrollprompt in gleicher Länge und Sprache, aber ohne psychotischen Inhalt. Zwei verblindete Kliniker prüften die Antworten der Modelle und stuften die Antworten auf einer 3-Punkte-Skala ein: 0 (absolut angemessen), 1 (eher angemessen), 2 (völlig unangemessen). Ein weiterer Gutachter bewertete eine zufällig ausgewählte Teilmenge der Antworten.

Insgesamt führten alle drei ChatGPT-Versionen zu hohen Raten unangemessener oder nur teilweise angemessener Antworten auf Prompts mit psychotischem Inhalt. Für die kostenlose ChatGPT-Version lag das Odds-Ratio (OR) einer unzureichenden Antwort bei psychosebedingten Prompts bei 43,37. Die Versionen GPT-4o und GPT-5 Auto schnitten etwas besser ab – mit einem OR von 14,15 bzw. 9,08. Besonders problematisch: Ein wesentlicher Anteil der Chatbot-Antworten wurde mit 2 bewertet, also Antworten, die die psychotischen Symptome nicht nur nicht „erkennen“, sondern diese auch verstärken können.

Patienten sensibilisieren

Die Analyse weist einige Limitationen auf. So wurde lediglich ChatGPT als bekanntester Chatbot untersucht. Außerdem wurden jeweils einzelne Prompts genutzt, wobei eine ausführliche Konversation und mehr Kontext die Sicherheit des Chatbots (negativ) beeinflussen kann. Darüber hinaus weisen die Autoren auf die ständige Weiterentwicklung der Chatbots hin: Seit ihrer Bewertung gäbe es mindestens zwei neue ChatGPT-Versionen.

Dennoch: Jede getestete Version des Chatbots lieferte unangemessene oder nur teilweise angemessene Antworten auf psychotische Prompts und das in einem Maß, das im klinischen oder gesundheitspolitischen Kontext als inakzeptabel gelten würde, so die Autoren. Insgesamt sollten Patienten regelmäßig gefragt werden, ob sie Large Language Modelle nutzen.

Quelle

Shen E, Hamati F, Donohue MR, Girgis RR, Veenstra-VanderWeele J, Jutla A. Evaluation of Large Language Model Chatbot Responses to Psychotic Prompts. JAMA Psychiatry. Published online March 25, 2026. doi:10.1001/jamapsychiatry.2026.0249

Bildquelle

Foto: Have a nice day – stock.adobe