Therapon AI

Reconstructing Standardized Measurement from Narrative Speech

Evidenzgebundene Schätzung von Fragebogenwerten aus narrativen Interviews
Michael Kizil · Klinischer Psychologe und Psychotherapeut
Arbeitsstand von September 2026
Sekundäranalyse der eigenen Erhebung: 38 narrative Interviews, sieben psychometrische Fragebögen, Schätzung durch ein Sprachmodell mit Belegpflicht. Vorläufige Befunde, nicht begutachtet.
I · Stand und Lücke

In aktuellen Studien schätzen Sprachmodelle Fragebogenscores valide aus narrativer Sprache; wie sie zu ihren Werten kommen, bleibt häufig unklar (Explainable AI)

Stand der Forschung
Chen et al. 2026 · N = 348 · o3-mini
Ein Modell schätzt aus klinischen Interviews die Symptomschwere (BPRS), die sonst ein Behandler einstuft. Begründet jeden Wert frei, nicht gegen das Transkript geprüft.
r = .58
Sokol & Goodman 2026 · N = 164 · Claude 3.5 Sonnet
Ein Modell rekonstruiert aus gesprochenen Antworten einen Selbstbericht zur Verbundenheit mit dem zukünftigen Selbst (FSC). Begründet ebenfalls in freiem Text, ungeprüft.
r = .57
Oltmanns et al. 2026 · N = 1.409 · RoBERTa, feinjustiert
Ein Modell schätzt aus Lebenserzählungen die fünf Persönlichkeitsdimensionen (NEO-PI-R), ohne dass danach gefragt wurde. Keine Begründung je Person, nur Gruppen-Wortmuster.
r = .41
Die Lücke
„We did not perform formal explainability, calibration, or subgroup-fairness analyses, so we cannot determine which transcript features drove model judgments."
Teferra et al. 2026 · N = 100 · u. a. GPT-5, Claude Sonnet 4, DeepSeek 3.1
Ein Modell schätzt aus klinischen Interviews item-weise PTSD-Symptome (PCL-C).
2
II · Verfahren

Genau hier setzt der vorgestellte Ansatz an: Das Modell simuliert die Selbstauskunft der Person und legt zu jedem Wert die Belegstelle offen

01
Das Gespräch
Das Transkript eines frei geführten Gesprächs zum Selbstwert, nur die Aussagen der Proband:in; die Fragebogen-Items kommen darin nicht zur Sprache.
02
Perspektivübernahme
Das Modell schätzt die sieben Fragebögen so, wie die Proband:in sie selbst ausgefüllt hätte, nicht als Urteil über sie.
03
Beleg vor Wert
Zu jedem Item zuerst ein wörtliches Zitat, dann der Wert; jedes Zitat wird gegen das Transkript geprüft. Ohne Textstelle: unbelegt vermerkt, aus dem Gesamtbild geschätzt.
für das
Modell
gesperrt
04
Validierung
Je Fragebogen wird der Summenscore des Modells mit dem echten Summenscore derselben Proband:in verglichen.
Verblindet: Opus 5 schätzt allein aus dem Gesprächstext; die echten Werte bleiben ihm verborgen.
Prompting
„Du schätzt für EINE Person diesen Fragebogen, so wie die Person ihn selbst ausgefüllt hätte. […] SCHRITT 1: Sammle ZUERST die Belegstellen, BEVOR du irgendeinen Wert vergibst. […] Gibt der Text zu einem Item nichts her, trag das Item in ‚items_ohne_beleg' ein und erfinde KEIN Zitat. […] SCHRITT 2: Vergib ERST DANACH die Werte […]. Für Items ohne Beleg schätze aus dem Gesamtbild."
3
II · Verfahren

Ein Fall aus der eigenen Erhebung: Modell und Fragebogen liegen zwei Punkte auseinander; die Textstellen zeigen, wo die Differenz entsteht

GAD-7 · Löwe et al. 2008 · Fall 01
Wie oft fühlten Sie sich im Verlauf der letzten 2 Wochen durch die folgenden Beschwerden beeinträchtigt?
0 Überhaupt nicht · 1 An einzelnen Tagen · 2 An mehr als der Hälfte der Tage · 3 Beinahe jeden Tag
Modellschätzung Tatsächlicher Fragebogenwert beide gleich
0
1
2
3
a · Nervosität, Ängstlichkeit oder Anspannung
b · Nicht in der Lage sein, Sorgen zu stoppen oder zu kontrollieren
c · Übermäßige Sorgen bezüglich verschiedener Angelegenheiten
d · Schwierigkeiten zu entspannen
e · Rastlosigkeit, so dass Stillsitzen schwer fällt
f · Schnelle Verärgerung oder Gereiztheit
g · Gefühl der Angst, so als würde etwas Schlimmes passieren
GAD-7-Summenscore · Skala 0–21 · Cut-off 10
Modellschätzung
13
Tatsächlicher Summenscore
15
Textstellen, aus denen das Modell schätzt · drei Items, eines ohne Beleg
„Ich habe ADHS-Anxiety. Ich will 1000 Sachen machen, dann bin ich manchmal gelähmt und brauche Zeit, Gedanken zu ordnen, und das dauert lange."
a · Nervosität, Ängstlichkeit oder Anspannung → geschätzter Wert 2
„Ich habe den Laden extra so aufgebaut, dass ich andere Sachen machen kann. Ich kann nicht dasitzen — das wäre verschwendete Zeit, wenn ich andere Sachen machen will."
e · Rastlosigkeit → geschätzter Wert 3
„Ich kann das schwer zurückhalten. Wenn mich jemand nervt, sage ich das. Ich bewerte andere genauso hart wie mich selbst."
f · Schnelle Verärgerung oder Gereiztheit → geschätzter Wert 2
[keine Textstelle im Gespräch]". Vermerk des Modells: „keine Befürchtung drohenden Unheils erkennbar", daher aus dem Gesamtbild geschätzt.
g · Gefühl der Angst → ohne Beleg · geschätzter Wert 0, tatsächlich 1
Anmerkung. Fall 01, mit Einverständnis. Alle 7.805 Zitate des Laufs wurden maschinell gegen die Transkripte geprüft; keines war erfunden.
4
II · Datenbasis

Die Datenbasis: 38 Personen, je sieben Fragebögen und ein Interview; die Erzählungen gehen inhaltlich weit auseinander

Erzählgenerierende Eingangsfrage
„Erzähl von einer Situation, in der dein Selbstwert eine Rolle gespielt hat."
Für alle 38 identisch; danach nicht-direktiv geführt, ohne Leitfaden.
Inhaltliche Heterogenität der Erzählungen
27.3
von 38
Vendi-Score (Friedman & Dieng 2023), zentriert
Die 38 Interviews verhalten sich inhaltlich wie 27 völlig verschiedene; 1 hieße alle gleich, 38 alle verschieden.
.11
Jaccard-Median, ohne Stoppwörter
Zwei beliebige Interviews teilen rund ein Zehntel ihres Wortschatzes.
37
SD
Permutationstest, 20 Runden
Zufällig neu gemischte Sätze wären einander ähnlicher als die echten Interviews (cos .955 vs. .912).
Standardisierte Messinstrumente
Selbstwert
RSES · SESS · OPD-SF SR · OPD-KF K4a/K4p
Klinisch
PHQ-9 · GAD-7
Themen der 38 Gespräche
01Identität über Leistung
02Herrischer Großvater
03Übergewicht & Hänseleien
04Abwertung durch Lehrer
05Abitur & Alkohol
06Scheidung
07Toxisches Dating
08Freundschafts-Cliquen
09Arbeitslosigkeit
10Verrat der besten Freundin
11Autorität als Lehrerin
12Rap-Battles
13Haussanierung
14Bewertung im Beruf
15Trennung & Wegzug
16Bühnenauftritt
17Bewerbungsabsage
18Schwieriges Elternhaus
19Fremdsprachen-Unsicherheit
20Klinikpraktikum
21Studienabbruch
22Trennung & Alleinsein
23Trennung nach 18 Jahren
24Wiederkehrende Zweifel
25Depression
26Konflikt mit dem Vater
27Trennung der Eltern
28Rassistische Hänselei
29Fehler in der Abinote
30Unerfülltes Potenzial
31Verlust des Familienbetriebs
32Lehrprobe & Karriere
33Körperbild (X-Beine)
34Jobsuche & Absagen
35Anderssein in der Schule
36Unsicherer Berufseinstieg
37Stabiler Selbstwert
38Rückzug in der Pubertät
Anmerkung. Nur Teilnehmertext, 3.450 Sätze, Einbettungen all-MiniLM-L12-v2; zentriert = bereinigt um das allen Texten Gemeinsame (Sprache, Gattung, Eingangsfrage).
5
III · Befunde

Aus Gesprächen über den Selbstwert korrelieren Modellschätzung und Selbstauskunft bei allen sieben Konstrukten, selbst bei Depression und Angst

Stichprobe
N = 38, nicht-klinische Gelegenheitsstichprobe · 24 Männer, 14 Frauen · Ø 37.8 Jahre (20 bis 73) · 28 mit Hochschulstudium
Konstrukt
Skala
M (SD)
r
p
95-%-KI
ICC(A,1)
0r mit 95-%-KI1
Selbstwert
RSES Globaler Selbstwert
10–40
34.1 (4.5)
.57
< .001
[.19, .76]
.56
SESS Selbstwertstabilität
3–18
13.5 (2.5)
.65
< .001
[.39, .82]
.60
OPD-SF-SR Selbstwertregulation
0–16
3.9 (2.5)
.45
.004
[.13, .73]
.45
OPD-KF K4a Konflikt, aktiv
0–20
10.1 (3.5)
.63
< .001
[.40, .79]
.40
OPD-KF K4p Konflikt, passiv
0–16
1.6 (2.2)
.61
< .001
[.07, .84]
.59
Symptomatik
PHQ-9 Depressivität
0–27
5.8 (4.2)
.60
< .001
[.08, .81]
.47
GAD-7 Angst
0–21
5.3 (3.7)
.64
< .001
[.27, .82]
.60
Mittel
.59
.52
Anmerkung. Schätzung mit Opus 5, Mittel aus drei Durchgängen. M (SD) der Fragebogen-Summenscores. r = Pearson-Korrelation, ICC(A,1) = absolute Übereinstimmung, 95-%-KI = Perzentil-Bootstrap (B = 10.000). Gestrichelt: kritisches r bei α = .05/7 (Bonferroni).
6
IV · Ausblick

Wenn Sprache rechenbar wird: Was bleibt vom Unterschied zwischen Erzählen und Messen, und was geht verloren, wenn man ihn aufgibt?

Lassen sich aus einer Erzählung über den Selbstwert Depressivität und Angst schätzen, ohne dass danach gefragt wurde, ist die Grenze zwischen Erzählen und Messen durchlässiger, als die Instrumente unterstellen. Was ein Fragebogen in Items zerlegt, liegt im Erzählten als Ganzem, über das Gespräch verteilt und nicht immer an einzelne Sätze gebunden. Die Frage, was beim Übergang vom Erzählen zum Messen verloren geht, ist damit keine rein philosophische mehr, sondern eine, die sich untersuchen lässt.
“Compared to open-ended natural language, the rating scale method is overly reductionist.”
Kjell, Kjell & Schwartz, 2024, S. 3
Michael Kizil
Klinischer Psychologe und Psychotherapeut · michael.kizil@gmail.com · +49 162 281 11 17
Arbeitsstand September 2026
7
Anhang

Literatur

Altmann, T., & Roth, M. (2018). The Self-Esteem Stability Scale (SESS) for cross-sectional direct assessment of self-esteem stability. Frontiers in Psychology, 9, 91.
Benecke, C., Henkel, M., Doering, S., Jakobsen, T., Stasch, M., Dahlbender, R., Alhabbo, S., & Zimmermann, J. (2018). Der OPD-Konfliktfragebogen. Zeitschrift für Psychosomatische Medizin und Psychotherapie, 64(4), 380–393.
Chen, A. X., Horga, G., & Escola, S. (2026). Using large language models to measure symptom severity scores in patients at-risk for schizophrenia. Schizophrenia Bulletin, 52(5), sbag084.
Ehrenthal, J. C., Dinger, U., Horsch, L., Komo-Lang, M., Klinkerfuß, M., Grande, T., & Schauenburg, H. (2012). Der OPD-Strukturfragebogen (OPD-SF): Erste Ergebnisse zu Reliabilität und Validität. PPmP – Psychotherapie · Psychosomatik · Medizinische Psychologie, 62(1), 25–32.
Friedman, D., & Dieng, A. B. (2023). The Vendi Score: A diversity evaluation metric for machine learning. Transactions on Machine Learning Research.
Gräfe, K., Zipfel, S., Herzog, W., & Löwe, B. (2004). Screening psychischer Störungen mit dem „Gesundheitsfragebogen für Patienten (PHQ-D)": Ergebnisse der deutschen Validierungsstudie. Diagnostica, 50(4), 171–181.
Kjell, O. N. E., Kjell, K., & Schwartz, H. A. (2024). Beyond rating scales: With targeted evaluation, large language models are poised for psychological assessment. Psychiatry Research, 333, 115667.
Kroenke, K., Spitzer, R. L., & Williams, J. B. W. (2001). The PHQ-9: Validity of a brief depression severity measure. Journal of General Internal Medicine, 16(9), 606–613.
Löwe, B., Decker, O., Müller, S., Brähler, E., Schellberg, D., Herzog, W., & Herzberg, P. Y. (2008). Validation and standardization of the Generalized Anxiety Disorder Screener (GAD-7) in the general population. Medical Care, 46(3), 266–274.
Oltmanns, J. R., Khandelwal, R., Ma, J., Brickman, J., Do, T., Hussain, R., & Gupta, M. (2026). Language-based AI modeling of personality traits and pathology from life narrative interviews. Journal of Psychopathology and Clinical Science, 135, 122–135.
Rosenberg, M. (1965). Society and the adolescent self-image. Princeton University Press.
Sokol, Y., & Goodman, M. (2026). From Likert scales to large language models: Validating a computational approach to psychological assessment of future self-continuity. Journal of Personality Assessment, 108(3), 437–447.
Spitzer, R. L., Kroenke, K., Williams, J. B. W., & Löwe, B. (2006). A brief measure for assessing generalized anxiety disorder: The GAD-7. Archives of Internal Medicine, 166(10), 1092–1097.
Teferra, B. G., Sidharta, C. K., Hsiang, W.-N., Rueda, A., Guan, B., Zhang, Y., … Bhat, V. (2026). Zero-shot large language models for preliminary prediction of PTSD symptoms from clinical interview transcripts. The Canadian Journal of Psychiatry.
von Collani, G., & Herzberg, P. Y. (2003). Eine revidierte Fassung der deutschsprachigen Skala zum Selbstwertgefühl von Rosenberg. Zeitschrift für Differentielle und Diagnostische Psychologie, 24(1), 3–7.
8
Therapon AI01 / 08

Reconstructing Standardized Measurement from Narrative Speech

Evidenzgebundene Schätzung von Fragebogenwerten aus narrativen Interviews

Michael Kizil · Klinischer Psychologe und Psychotherapeut

Arbeitsstand von September 2026

Sekundäranalyse der eigenen Erhebung: 38 narrative Interviews, sieben psychometrische Fragebögen, Schätzung durch ein Sprachmodell mit Belegpflicht. Vorläufige Befunde, nicht begutachtet.

I · Stand und Lücke02 / 08

In aktuellen Studien schätzen Sprachmodelle Fragebogenscores valide aus narrativer Sprache; wie sie zu ihren Werten kommen, bleibt häufig unklar (Explainable AI)

Stand der Forschung

Chen et al. 2026 · N = 348 · o3-mini

Ein Modell schätzt aus klinischen Interviews die Symptomschwere (BPRS), die sonst ein Behandler einstuft. Begründet jeden Wert frei, nicht gegen das Transkript geprüft.

r = .58Sokol & Goodman 2026 · N = 164 · Claude 3.5 Sonnet

Ein Modell rekonstruiert aus gesprochenen Antworten einen Selbstbericht zur Verbundenheit mit dem zukünftigen Selbst (FSC). Begründet ebenfalls in freiem Text, ungeprüft.

r = .57Oltmanns et al. 2026 · N = 1.409 · RoBERTa, feinjustiert

Ein Modell schätzt aus Lebenserzählungen die fünf Persönlichkeitsdimensionen (NEO-PI-R), ohne dass danach gefragt wurde. Keine Begründung je Person, nur Gruppen-Wortmuster.

r = .41
Die Lücke

„We did not perform formal explainability, calibration, or subgroup-fairness analyses, so we cannot determine which transcript features drove model judgments."

Teferra et al. 2026 · N = 100 · u. a. GPT-5, Claude Sonnet 4, DeepSeek 3.1

Ein Modell schätzt aus klinischen Interviews item-weise PTSD-Symptome (PCL-C).

II · Verfahren03 / 08

Genau hier setzt der vorgestellte Ansatz an: Das Modell simuliert die Selbstauskunft der Person und legt zu jedem Wert die Belegstelle offen

01Das Gespräch

Das Transkript eines frei geführten Gesprächs zum Selbstwert, nur die Aussagen der Proband:in; die Fragebogen-Items kommen darin nicht zur Sprache.

02Perspektivübernahme

Das Modell schätzt die sieben Fragebögen so, wie die Proband:in sie selbst ausgefüllt hätte, nicht als Urteil über sie.

03Beleg vor Wert

Zu jedem Item zuerst ein wörtliches Zitat, dann der Wert; jedes Zitat wird gegen das Transkript geprüft. Ohne Textstelle: unbelegt vermerkt, aus dem Gesamtbild geschätzt.

für das Modell gesperrt

04Validierung

Je Fragebogen wird der Summenscore des Modells mit dem echten Summenscore derselben Proband:in verglichen.

Verblindet: Opus 5 schätzt allein aus dem Gesprächstext; die echten Werte bleiben ihm verborgen.

Prompting

„Du schätzt für EINE Person diesen Fragebogen, so wie die Person ihn selbst ausgefüllt hätte. […] SCHRITT 1: Sammle ZUERST die Belegstellen, BEVOR du irgendeinen Wert vergibst. […] Gibt der Text zu einem Item nichts her, trag das Item in ‚items_ohne_beleg' ein und erfinde KEIN Zitat. […] SCHRITT 2: Vergib ERST DANACH die Werte […]. Für Items ohne Beleg schätze aus dem Gesamtbild."

II · Verfahren04 / 08

Ein Fall aus der eigenen Erhebung: Modell und Fragebogen liegen zwei Punkte auseinander; die Textstellen zeigen, wo die Differenz entsteht

GAD-7 · Löwe et al. 2008 · Fall 01

Wie oft fühlten Sie sich im Verlauf der letzten 2 Wochen durch die folgenden Beschwerden beeinträchtigt?

0 Überhaupt nicht · 1 An einzelnen Tagen · 2 An mehr als der Hälfte der Tage · 3 Beinahe jeden Tag

Modellschätzung Tatsächlicher Fragebogenwert beide gleich

0123
a · Nervosität, Ängstlichkeit oder Anspannung
b · Nicht in der Lage sein, Sorgen zu stoppen oder zu kontrollieren
c · Übermäßige Sorgen bezüglich verschiedener Angelegenheiten
d · Schwierigkeiten zu entspannen
e · Rastlosigkeit, so dass Stillsitzen schwer fällt
f · Schnelle Verärgerung oder Gereiztheit
g · Gefühl der Angst, so als würde etwas Schlimmes passieren
GAD-7-Summenscore · Skala 0–21 · Cut-off 10
13Modellschätzung
15Tatsächlicher Summenscore

Textstellen, aus denen das Modell schätzt · drei Items, eines ohne Beleg

„Ich habe ADHS-Anxiety. Ich will 1000 Sachen machen, dann bin ich manchmal gelähmt und brauche Zeit, Gedanken zu ordnen, und das dauert lange."

a · Nervosität, Ängstlichkeit oder Anspannung → geschätzter Wert 2

„Ich habe den Laden extra so aufgebaut, dass ich andere Sachen machen kann. Ich kann nicht dasitzen — das wäre verschwendete Zeit, wenn ich andere Sachen machen will."

e · Rastlosigkeit → geschätzter Wert 3

„Ich kann das schwer zurückhalten. Wenn mich jemand nervt, sage ich das. Ich bewerte andere genauso hart wie mich selbst."

f · Schnelle Verärgerung oder Gereiztheit → geschätzter Wert 2

„ [keine Textstelle im Gespräch]". Vermerk des Modells: „keine Befürchtung drohenden Unheils erkennbar", daher aus dem Gesamtbild geschätzt.

g · Gefühl der Angst → ohne Beleg · geschätzter Wert 0, tatsächlich 1

Anmerkung. Fall 01, mit Einverständnis. Alle 7.805 Zitate des Laufs wurden maschinell gegen die Transkripte geprüft; keines war erfunden.

II · Datenbasis05 / 08

Die Datenbasis: 38 Personen, je sieben Fragebögen und ein Interview; die Erzählungen gehen inhaltlich weit auseinander

Erzählgenerierende Eingangsfrage

„Erzähl von einer Situation, in der dein Selbstwert eine Rolle gespielt hat."

Für alle 38 identisch; danach nicht-direktiv geführt, ohne Leitfaden.

Inhaltliche Heterogenität der Erzählungen

27.3von 38 · Vendi-Score (Friedman & Dieng 2023), zentriert

Die 38 Interviews verhalten sich inhaltlich wie 27 völlig verschiedene; 1 hieße alle gleich, 38 alle verschieden.

.11Jaccard-Median, ohne Stoppwörter · Zwei beliebige Interviews teilen rund ein Zehntel ihres Wortschatzes.
37SD · Permutationstest, 20 Runden

Zufällig neu gemischte Sätze wären einander ähnlicher als die echten Interviews (cos .955 vs. .912).

Standardisierte Messinstrumente

Selbstwert

RSES · SESS · OPD-SF SR · OPD-KF K4a/K4p

Klinisch

PHQ-9 · GAD-7

Themen der 38 Gespräche

  • 01Identität über Leistung
  • 02Herrischer Großvater
  • 03Übergewicht & Hänseleien
  • 04Abwertung durch Lehrer
  • 05Abitur & Alkohol
  • 06Scheidung
  • 07Toxisches Dating
  • 08Freundschafts-Cliquen
  • 09Arbeitslosigkeit
  • 10Verrat der besten Freundin
  • 11Autorität als Lehrerin
  • 12Rap-Battles
  • 13Haussanierung
  • 14Bewertung im Beruf
  • 15Trennung & Wegzug
  • 16Bühnenauftritt
  • 17Bewerbungsabsage
  • 18Schwieriges Elternhaus
  • 19Fremdsprachen-Unsicherheit
  • 20Klinikpraktikum
  • 21Studienabbruch
  • 22Trennung & Alleinsein
  • 23Trennung nach 18 Jahren
  • 24Wiederkehrende Zweifel
  • 25Depression
  • 26Konflikt mit dem Vater
  • 27Trennung der Eltern
  • 28Rassistische Hänselei
  • 29Fehler in der Abinote
  • 30Unerfülltes Potenzial
  • 31Verlust des Familienbetriebs
  • 32Lehrprobe & Karriere
  • 33Körperbild (X-Beine)
  • 34Jobsuche & Absagen
  • 35Anderssein in der Schule
  • 36Unsicherer Berufseinstieg
  • 37Stabiler Selbstwert
  • 38Rückzug in der Pubertät

Anmerkung. Nur Teilnehmertext, 3.450 Sätze, Einbettungen all-MiniLM-L12-v2; zentriert = bereinigt um das allen Texten Gemeinsame (Sprache, Gattung, Eingangsfrage).

III · Befunde06 / 08

Aus Gesprächen über den Selbstwert korrelieren Modellschätzung und Selbstauskunft bei allen sieben Konstrukten, selbst bei Depression und Angst

Stichprobe

N = 38, nicht-klinische Gelegenheitsstichprobe · 24 Männer, 14 Frauen · Ø 37.8 Jahre (20 bis 73) · 28 mit Hochschulstudium

Konstrukt0r mit 95-%-KI1
Selbstwert
RSES Globaler Selbstwert
r .57p < .00195-%-KI [.19, .76]ICC(A,1) .56Skala 10–40M (SD) 34.1 (4.5)
SESS Selbstwertstabilität
r .65p < .00195-%-KI [.39, .82]ICC(A,1) .60Skala 3–18M (SD) 13.5 (2.5)
OPD-SF-SR Selbstwertregulation
r .45p .00495-%-KI [.13, .73]ICC(A,1) .45Skala 0–16M (SD) 3.9 (2.5)
OPD-KF K4a Konflikt, aktiv
r .63p < .00195-%-KI [.40, .79]ICC(A,1) .40Skala 0–20M (SD) 10.1 (3.5)
OPD-KF K4p Konflikt, passiv
r .61p < .00195-%-KI [.07, .84]ICC(A,1) .59Skala 0–16M (SD) 1.6 (2.2)
Symptomatik
PHQ-9 Depressivität
r .60p < .00195-%-KI [.08, .81]ICC(A,1) .47Skala 0–27M (SD) 5.8 (4.2)
GAD-7 Angst
r .64p < .00195-%-KI [.27, .82]ICC(A,1) .60Skala 0–21M (SD) 5.3 (3.7)
Mittel
r .59ICC(A,1) .52

Anmerkung. Schätzung mit Opus 5, Mittel aus drei Durchgängen. M (SD) der Fragebogen-Summenscores. r = Pearson-Korrelation, ICC(A,1) = absolute Übereinstimmung, 95-%-KI = Perzentil-Bootstrap (B = 10.000). Gestrichelt: kritisches r bei α = .05/7 (Bonferroni).

IV · Ausblick07 / 08

Wenn Sprache rechenbar wird: Was bleibt vom Unterschied zwischen Erzählen und Messen, und was geht verloren, wenn man ihn aufgibt?

Lassen sich aus einer Erzählung über den Selbstwert Depressivität und Angst schätzen, ohne dass danach gefragt wurde, ist die Grenze zwischen Erzählen und Messen durchlässiger, als die Instrumente unterstellen. Was ein Fragebogen in Items zerlegt, liegt im Erzählten als Ganzem, über das Gespräch verteilt und nicht immer an einzelne Sätze gebunden. Die Frage, was beim Übergang vom Erzählen zum Messen verloren geht, ist damit keine rein philosophische mehr, sondern eine, die sich untersuchen lässt.

“Compared to open-ended natural language, the rating scale method is overly reductionist.”

Kjell, Kjell & Schwartz, 2024, S. 3

Michael Kizil

Klinischer Psychologe und Psychotherapeut · michael.kizil@gmail.com · +49 162 281 11 17

Arbeitsstand September 2026

Anhang08 / 08

Literatur

Altmann, T., & Roth, M. (2018). The Self-Esteem Stability Scale (SESS) for cross-sectional direct assessment of self-esteem stability. Frontiers in Psychology, 9, 91.

Benecke, C., Henkel, M., Doering, S., Jakobsen, T., Stasch, M., Dahlbender, R., Alhabbo, S., & Zimmermann, J. (2018). Der OPD-Konfliktfragebogen. Zeitschrift für Psychosomatische Medizin und Psychotherapie, 64(4), 380–393.

Chen, A. X., Horga, G., & Escola, S. (2026). Using large language models to measure symptom severity scores in patients at-risk for schizophrenia. Schizophrenia Bulletin, 52(5), sbag084.

Ehrenthal, J. C., Dinger, U., Horsch, L., Komo-Lang, M., Klinkerfuß, M., Grande, T., & Schauenburg, H. (2012). Der OPD-Strukturfragebogen (OPD-SF): Erste Ergebnisse zu Reliabilität und Validität. PPmP – Psychotherapie · Psychosomatik · Medizinische Psychologie, 62(1), 25–32.

Friedman, D., & Dieng, A. B. (2023). The Vendi Score: A diversity evaluation metric for machine learning. Transactions on Machine Learning Research.

Gräfe, K., Zipfel, S., Herzog, W., & Löwe, B. (2004). Screening psychischer Störungen mit dem „Gesundheitsfragebogen für Patienten (PHQ-D)": Ergebnisse der deutschen Validierungsstudie. Diagnostica, 50(4), 171–181.

Kjell, O. N. E., Kjell, K., & Schwartz, H. A. (2024). Beyond rating scales: With targeted evaluation, large language models are poised for psychological assessment. Psychiatry Research, 333, 115667.

Kroenke, K., Spitzer, R. L., & Williams, J. B. W. (2001). The PHQ-9: Validity of a brief depression severity measure. Journal of General Internal Medicine, 16(9), 606–613.

Löwe, B., Decker, O., Müller, S., Brähler, E., Schellberg, D., Herzog, W., & Herzberg, P. Y. (2008). Validation and standardization of the Generalized Anxiety Disorder Screener (GAD-7) in the general population. Medical Care, 46(3), 266–274.

Oltmanns, J. R., Khandelwal, R., Ma, J., Brickman, J., Do, T., Hussain, R., & Gupta, M. (2026). Language-based AI modeling of personality traits and pathology from life narrative interviews. Journal of Psychopathology and Clinical Science, 135, 122–135.

Rosenberg, M. (1965). Society and the adolescent self-image. Princeton University Press.

Sokol, Y., & Goodman, M. (2026). From Likert scales to large language models: Validating a computational approach to psychological assessment of future self-continuity. Journal of Personality Assessment, 108(3), 437–447.

Spitzer, R. L., Kroenke, K., Williams, J. B. W., & Löwe, B. (2006). A brief measure for assessing generalized anxiety disorder: The GAD-7. Archives of Internal Medicine, 166(10), 1092–1097.

Teferra, B. G., Sidharta, C. K., Hsiang, W.-N., Rueda, A., Guan, B., Zhang, Y., … Bhat, V. (2026). Zero-shot large language models for preliminary prediction of PTSD symptoms from clinical interview transcripts. The Canadian Journal of Psychiatry.

von Collani, G., & Herzberg, P. Y. (2003). Eine revidierte Fassung der deutschsprachigen Skala zum Selbstwertgefühl von Rosenberg. Zeitschrift für Differentielle und Diagnostische Psychologie, 24(1), 3–7.