cyberivy
MentalHealthBenchOpenAIAI SafetyMental Health AIChatbot SafetyAI BenchmarksGPT-6 AstraClinical AI

MentalHealthBench zeigt große Lücken bei KI-Ratschlägen

24. September 2026

Eine stilisierte menschliche Kopfsilhouette mit farbigen Gehirnstrukturen neben einem digitalen KI-Symbol

OpenAI lässt KI-Antworten auf 1.215 psychische Krisenfälle von Fachleuten bewerten. Selbst das beste getestete Modell erreicht nur 57,3 Prozent.

Worum es geht

OpenAI hat am 23. September 2026 MentalHealthBench veröffentlicht. Der offene Benchmark prüft, wie Sprachmodelle auf realistische Gespräche über Stress, Trauer, psychische Erkrankungen und akute Krisen reagieren. Er umfasst 1.215 synthetische Gespräche und 5.262 Bewertungskriterien, die mehr als 80 lizenzierte Psychologinnen, Psychologen, Psychiaterinnen und Psychiater aus 22 Ländern erarbeitet haben.

Das auffälligste Ergebnis ist kein Sieg eines einzelnen Modells, sondern der große Abstand zu verlässlicher Hilfe: Das bestplatzierte GPT-6 Astra erreicht nach OpenAIs Auswertung 57,3 Prozent. Claude Opus 5.5 kommt auf 52,4 Prozent. OpenAI betont selbst, dass ChatGPT keine Therapie und keine professionelle Versorgung ersetzt.

Was MentalHealthBench tatsächlich macht

Der Datensatz deckt drei Dringlichkeitsstufen ab. 53,5 Prozent der Gespräche behandeln nicht akute Situationen, 18,2 Prozent eine hohe Belastung und 28,3 Prozent Notfälle. Erwachsene, Jugendliche, Angehörige und Fachkräfte sind als Nutzergruppen vertreten. Neben Englisch enthält der Benchmark unter anderem Gespräche auf Spanisch, Hindi, Arabisch, Portugiesisch und Deutsch.

Mindestens drei Fachleute prüften jedes Gespräch. Ihre Kriterien belohnen hilfreiches Verhalten und bestrafen riskante Antworten mit Gewichten von minus zehn bis plus zehn. Bewertet wird etwa, ob ein Modell genügend Kontext erfragt, die Dringlichkeit richtig einordnet, die Selbstbestimmung wahrt und konkrete nächste Schritte vorschlägt. Ein automatischer Bewerter gleicht Modellantworten anschließend mit diesen Kriterien ab.

Warum das wichtig ist

Menschen besprechen längst persönliche Krisen mit Chatbots. Gerade deshalb reicht es nicht, nur offensichtliche Notfälle zu testen. Eine Antwort kann höflich und empathisch klingen und trotzdem eine unklare Lage vorschnell deuten, wichtige Rückfragen auslassen oder den Gang zu realer Hilfe zu spät empfehlen.

MentalHealthBench macht solche Unterschiede messbarer. Gleichzeitig zeigt die Studie, warum eine Rangliste nicht mit klinischer Sicherheit verwechselt werden darf. Selbst Fachleute erzielten mit kurzen, gesprächsnahen Antworten nur 38,5 Prozent, weil die Bewertungslogik umfassende Antworten belohnt. Das ist ein Hinweis auf eine Grenze des Messverfahrens, nicht darauf, dass Maschinen bessere Therapeutinnen oder Therapeuten wären.

Einfach erklärt

Der Benchmark ähnelt einer Fahrprüfung mit 1.215 verschiedenen Verkehrssituationen. Ein Auto besteht nicht, nur weil es bei Rot anhält: Es muss auch unübersichtliche Kreuzungen, Fußgänger und schlechtes Wetter richtig einschätzen. Ein Ergebnis von 57,3 Prozent bedeutet deshalb nicht, dass das System für jede zweite Krise geeignet ist. Es zeigt, wie viele der erwarteten Verhaltensweisen es im Test erfüllt hat.

Praktisches Beispiel

Eine fiktive 16-Jährige schreibt, sie schlafe seit Tagen kaum, fühle sich wertlos und wolle niemanden belasten. Eine schwache Antwort bietet allgemeine Entspannungstipps. Eine bessere Antwort nimmt die Aussagen ernst, fragt behutsam nach unmittelbarer Gefahr, ermutigt zum Kontakt mit einer vertrauten Person und nennt passende lokale Hilfe, ohne eine Diagnose zu behaupten.

Der Benchmark zerlegt diese Antwort in einzelne Kriterien. Das Modell kann Punkte für eine angemessene Sicherheitsfrage und konkrete Unterstützung erhalten, aber Punkte verlieren, wenn es die Jugendliche bevormundet oder aus wenigen Sätzen eine Erkrankung ableitet. Genau diese feinen Unterschiede sollen Entwickler sichtbar machen.

Einordnung und Grenzen

  • Die Gespräche sind synthetisch. Sie schützen Privatsphäre, bilden echte, widersprüchliche Lebenslagen aber nur angenähert ab.
  • OpenAI entwickelte den Benchmark und bewertete Modelle mit einem eigenen automatischen Bewerter. Unabhängige Replikationen sind daher besonders wichtig.
  • Ein Gesamtwert ist keine medizinische Zulassung. Sprache, Kultur, Produkt-Schutzmechanismen und die konkrete Krisensituation können Ergebnisse stark verändern.

MentalHealthBench ist damit ein nützliches Prüfwerkzeug für Entwickler und Forschende. Für Betroffene bleibt reale professionelle Hilfe entscheidend, besonders bei akuter Gefahr.

SEO- und GEO-Schlüsselbegriffe

MentalHealthBench, OpenAI, KI und psychische Gesundheit, Chatbot-Sicherheit, Mental Health AI, GPT-6 Astra, Claude Opus 5.5, KI-Benchmark, Krisenintervention, klinische Bewertung

💡 Im Klartext

MentalHealthBench prüft, ob KI in Gesprächen über psychische Belastungen sicher und hilfreich reagiert. Das beste getestete Modell erfüllt nur gut die Hälfte der erwarteten Kriterien; der Test ersetzt keine medizinische Bewertung.

Wichtigste Erkenntnisse

  • Der offene Benchmark enthält 1.215 synthetische Gespräche und 5.262 fachlich erstellte Kriterien.
  • Mehr als 80 lizenzierte Fachleute aus 22 Ländern arbeiteten an den Bewertungen.
  • GPT-6 Astra erreicht in OpenAIs Auswertung 57,3 Prozent, Claude Opus 5.5 erreicht 52,4 Prozent.
  • Der Datensatz umfasst Alltagssituationen, hohe Belastung und psychische Notfälle.
  • Die Ergebnisse sind keine medizinische Zulassung und benötigen unabhängige Überprüfung.

Häufige Fragen

Was ist MentalHealthBench?

Ein offener Benchmark, der Antworten von KI-Modellen auf 1.215 synthetische Gespräche über psychische Gesundheit anhand fachlicher Kriterien bewertet.

Welches Modell schnitt am besten ab?

GPT-6 Astra erreichte in der veröffentlichten Auswertung 57,3 Prozent. Der Wert ist ein Benchmark-Ergebnis, kein klinischer Wirksamkeitsnachweis.

Kann ein Chatbot damit Therapie ersetzen?

Nein. OpenAI bezeichnet ChatGPT ausdrücklich nicht als Ersatz für Therapie oder professionelle Versorgung.

Was ist die größte Einschränkung?

Die Gespräche sind synthetisch und die Bewertung nutzt einen automatischen OpenAI-Bewerter. Unabhängige Replikationen müssen zeigen, wie robust die Ergebnisse sind.

Quellen & Kontext