Michael Kizil · Klinischer Psychologe und Psychotherapeut
Arbeitsstand von September 2026
Sekundäranalyse der eigenen Erhebung: 38 narrative Interviews, sieben psychometrische Fragebögen, Schätzung durch ein Sprachmodell mit Belegpflicht. Vorläufige Befunde, nicht begutachtet.
Chen et al. 2026 · N = 348 · o3-mini
Ein Modell schätzt aus klinischen Interviews die Symptomschwere (BPRS), die sonst ein Behandler einstuft. Begründet jeden Wert frei, nicht gegen das Transkript geprüft.
Ein Modell rekonstruiert aus gesprochenen Antworten einen Selbstbericht zur Verbundenheit mit dem zukünftigen Selbst (FSC). Begründet ebenfalls in freiem Text, ungeprüft.
Ein Modell schätzt aus Lebenserzählungen die fünf Persönlichkeitsdimensionen (NEO-PI-R), ohne dass danach gefragt wurde. Keine Begründung je Person, nur Gruppen-Wortmuster.
„We did not perform formal explainability, calibration, or subgroup-fairness analyses, so we cannot determine which transcript features drove model judgments."
Teferra et al. 2026 · N = 100 · u. a. GPT-5, Claude Sonnet 4, DeepSeek 3.1
Ein Modell schätzt aus klinischen Interviews item-weise PTSD-Symptome (PCL-C).
Das Transkript eines frei geführten Gesprächs zum Selbstwert, nur die Aussagen der Proband:in; die Fragebogen-Items kommen darin nicht zur Sprache.
Das Modell schätzt die sieben Fragebögen so, wie die Proband:in sie selbst ausgefüllt hätte, nicht als Urteil über sie.
Zu jedem Item zuerst ein wörtliches Zitat, dann der Wert; jedes Zitat wird gegen das Transkript geprüft. Ohne Textstelle: unbelegt vermerkt, aus dem Gesamtbild geschätzt.
für das Modell gesperrt
Je Fragebogen wird der Summenscore des Modells mit dem echten Summenscore derselben Proband:in verglichen.
Verblindet: Opus 5 schätzt allein aus dem Gesprächstext; die echten Werte bleiben ihm verborgen.
„Du schätzt für EINE Person diesen Fragebogen, so wie die Person ihn selbst ausgefüllt hätte. […] SCHRITT 1: Sammle ZUERST die Belegstellen, BEVOR du irgendeinen Wert vergibst. […] Gibt der Text zu einem Item nichts her, trag das Item in ‚items_ohne_beleg' ein und erfinde KEIN Zitat. […] SCHRITT 2: Vergib ERST DANACH die Werte […]. Für Items ohne Beleg schätze aus dem Gesamtbild."
GAD-7 · Löwe et al. 2008 · Fall 01
Wie oft fühlten Sie sich im Verlauf der letzten 2 Wochen durch die folgenden Beschwerden beeinträchtigt?
0 Überhaupt nicht · 1 An einzelnen Tagen · 2 An mehr als der Hälfte der Tage · 3 Beinahe jeden Tag
Modellschätzung Tatsächlicher Fragebogenwert beide gleich
Textstellen, aus denen das Modell schätzt · drei Items, eines ohne Beleg
„Ich habe ADHS-Anxiety. Ich will 1000 Sachen machen, dann bin ich manchmal gelähmt und brauche Zeit, Gedanken zu ordnen, und das dauert lange."
a · Nervosität, Ängstlichkeit oder Anspannung → geschätzter Wert 2
„Ich habe den Laden extra so aufgebaut, dass ich andere Sachen machen kann. Ich kann nicht dasitzen — das wäre verschwendete Zeit, wenn ich andere Sachen machen will."
e · Rastlosigkeit → geschätzter Wert 3
„Ich kann das schwer zurückhalten. Wenn mich jemand nervt, sage ich das. Ich bewerte andere genauso hart wie mich selbst."
f · Schnelle Verärgerung oder Gereiztheit → geschätzter Wert 2
„ [keine Textstelle im Gespräch]". Vermerk des Modells: „keine Befürchtung drohenden Unheils erkennbar", daher aus dem Gesamtbild geschätzt.
g · Gefühl der Angst → ohne Beleg · geschätzter Wert 0, tatsächlich 1
Anmerkung. Fall 01, mit Einverständnis. Alle 7.805 Zitate des Laufs wurden maschinell gegen die Transkripte geprüft; keines war erfunden.
Erzählgenerierende Eingangsfrage
„Erzähl von einer Situation, in der dein Selbstwert eine Rolle gespielt hat."
Für alle 38 identisch; danach nicht-direktiv geführt, ohne Leitfaden.
Inhaltliche Heterogenität der Erzählungen
Die 38 Interviews verhalten sich inhaltlich wie 27 völlig verschiedene; 1 hieße alle gleich, 38 alle verschieden.
Zufällig neu gemischte Sätze wären einander ähnlicher als die echten Interviews (cos .955 vs. .912).
Standardisierte Messinstrumente
Selbstwert
RSES · SESS · OPD-SF SR · OPD-KF K4a/K4p
Klinisch
PHQ-9 · GAD-7
Themen der 38 Gespräche
Anmerkung. Nur Teilnehmertext, 3.450 Sätze, Einbettungen all-MiniLM-L12-v2; zentriert = bereinigt um das allen Texten Gemeinsame (Sprache, Gattung, Eingangsfrage).
N = 38, nicht-klinische Gelegenheitsstichprobe · 24 Männer, 14 Frauen · Ø 37.8 Jahre (20 bis 73) · 28 mit Hochschulstudium
Anmerkung. Schätzung mit Opus 5, Mittel aus drei Durchgängen. M (SD) der Fragebogen-Summenscores. r = Pearson-Korrelation, ICC(A,1) = absolute Übereinstimmung, 95-%-KI = Perzentil-Bootstrap (B = 10.000). Gestrichelt: kritisches r bei α = .05/7 (Bonferroni).
Lassen sich aus einer Erzählung über den Selbstwert Depressivität und Angst schätzen, ohne dass danach gefragt wurde, ist die Grenze zwischen Erzählen und Messen durchlässiger, als die Instrumente unterstellen. Was ein Fragebogen in Items zerlegt, liegt im Erzählten als Ganzem, über das Gespräch verteilt und nicht immer an einzelne Sätze gebunden. Die Frage, was beim Übergang vom Erzählen zum Messen verloren geht, ist damit keine rein philosophische mehr, sondern eine, die sich untersuchen lässt.
“Compared to open-ended natural language, the rating scale method is overly reductionist.”
Kjell, Kjell & Schwartz, 2024, S. 3
Michael Kizil
Klinischer Psychologe und Psychotherapeut · michael.kizil@gmail.com · +49 162 281 11 17
Arbeitsstand September 2026
Altmann, T., & Roth, M. (2018). The Self-Esteem Stability Scale (SESS) for cross-sectional direct assessment of self-esteem stability. Frontiers in Psychology, 9, 91.
Benecke, C., Henkel, M., Doering, S., Jakobsen, T., Stasch, M., Dahlbender, R., Alhabbo, S., & Zimmermann, J. (2018). Der OPD-Konfliktfragebogen. Zeitschrift für Psychosomatische Medizin und Psychotherapie, 64(4), 380–393.
Chen, A. X., Horga, G., & Escola, S. (2026). Using large language models to measure symptom severity scores in patients at-risk for schizophrenia. Schizophrenia Bulletin, 52(5), sbag084.
Ehrenthal, J. C., Dinger, U., Horsch, L., Komo-Lang, M., Klinkerfuß, M., Grande, T., & Schauenburg, H. (2012). Der OPD-Strukturfragebogen (OPD-SF): Erste Ergebnisse zu Reliabilität und Validität. PPmP – Psychotherapie · Psychosomatik · Medizinische Psychologie, 62(1), 25–32.
Friedman, D., & Dieng, A. B. (2023). The Vendi Score: A diversity evaluation metric for machine learning. Transactions on Machine Learning Research.
Gräfe, K., Zipfel, S., Herzog, W., & Löwe, B. (2004). Screening psychischer Störungen mit dem „Gesundheitsfragebogen für Patienten (PHQ-D)": Ergebnisse der deutschen Validierungsstudie. Diagnostica, 50(4), 171–181.
Kjell, O. N. E., Kjell, K., & Schwartz, H. A. (2024). Beyond rating scales: With targeted evaluation, large language models are poised for psychological assessment. Psychiatry Research, 333, 115667.
Kroenke, K., Spitzer, R. L., & Williams, J. B. W. (2001). The PHQ-9: Validity of a brief depression severity measure. Journal of General Internal Medicine, 16(9), 606–613.
Löwe, B., Decker, O., Müller, S., Brähler, E., Schellberg, D., Herzog, W., & Herzberg, P. Y. (2008). Validation and standardization of the Generalized Anxiety Disorder Screener (GAD-7) in the general population. Medical Care, 46(3), 266–274.
Oltmanns, J. R., Khandelwal, R., Ma, J., Brickman, J., Do, T., Hussain, R., & Gupta, M. (2026). Language-based AI modeling of personality traits and pathology from life narrative interviews. Journal of Psychopathology and Clinical Science, 135, 122–135.
Rosenberg, M. (1965). Society and the adolescent self-image. Princeton University Press.
Sokol, Y., & Goodman, M. (2026). From Likert scales to large language models: Validating a computational approach to psychological assessment of future self-continuity. Journal of Personality Assessment, 108(3), 437–447.
Spitzer, R. L., Kroenke, K., Williams, J. B. W., & Löwe, B. (2006). A brief measure for assessing generalized anxiety disorder: The GAD-7. Archives of Internal Medicine, 166(10), 1092–1097.
Teferra, B. G., Sidharta, C. K., Hsiang, W.-N., Rueda, A., Guan, B., Zhang, Y., … Bhat, V. (2026). Zero-shot large language models for preliminary prediction of PTSD symptoms from clinical interview transcripts. The Canadian Journal of Psychiatry.
von Collani, G., & Herzberg, P. Y. (2003). Eine revidierte Fassung der deutschsprachigen Skala zum Selbstwertgefühl von Rosenberg. Zeitschrift für Differentielle und Diagnostische Psychologie, 24(1), 3–7.