Przejdź do treści

Manuskrypt · strona towarzysząca

Baseline Intercepts Versus Persona Slopes: Stimulus and Administration Fidelity of Polish Narrative-Biography Personas in Large Language Models

Bazowe punkty przecięcia a nachylenia person: wierność bodźca i wierność administracji polskich person narracyjno-biograficznych w dużych modelach językowych

Michał Wiencek·Instytut Psychologii, Uniwersytet Komisji Edukacji Narodowej, Kraków

czerwiec 2026 · rewizja PDF 17.07.2026

Abstrakt

Duże modele językowe są coraz częściej używane jako zamienniki respondentów, ale dotychczasowe prace raportują silne obciążenie aprobatą społeczną i słabą wierność psychometryczną na poziomie jednostki przy krótkich promptach demograficznych. To badanie testuje reżim gęstszy: 30 polskich narracyjnych biografii pisanych w drugiej osobie (1489–2861 słów), z których każda koduje z góry ustalony profil 12 wymiarów, podanych siedmiu modelom od czterech producentów w warunkach persona, baseline i zero-prompt, z pięcioma narzędziami. Wyłaniają się cztery ustalenia. Po pierwsze, odpowiedzi uwarunkowane personą zgadzają się z celami zadeklarowanymi przez autora (styl przywiązania: κ Cohena = 0,69–0,96; κ Fleissa dla siedmiu modeli = 0,85). Ponieważ cele i klucz TCTM-22 są zdefiniowane przez autora i nie zostały niezależnie zwalidowane, są to wielkości wierności bodźca, nie oszacowania zwalidowanej trafności. Po drugie, odpowiadanie rozdziela się na kruche punkty przecięcia (poziomy) i przenośne nachylenia person (relatywne odwzorowania profilu i przyrosty): bazowe wyniki modeli różnią się nawet o 1,7 SD na polskich normach, a mimo to wszystkie 21 median korelacji profili między modelami przekracza 0,94. Po trzecie, zamrożenia odpowiedzi w oknie wdrożeniowym, opisowo bimodalna komórka post hoc (N = 31) i wielosigmowe przesunięcie bazowe zachodzą na osi poziomu, podczas gdy odwzorowania person replikują się przy medianie r ≥ 0,92. Po czwarte, naprawiona usterka renderowania bodźca i obciążone porównanie składu baterii pokazują, że zgodność z kluczem na poziomie pozycji zmienia się nawet o 98 punktów procentowych, gdy wyniki zagregowane pozostają porównywalnie stabilne. Wyniki motywują raportowanie wierności bodźca i administracji obok wyników z modelem w roli respondenta.

Tłumaczenie autorskie. Wersją wiążącą jest abstrakt w manuskrypcie (angielski).

Słowa kluczowerespondenci syntetyczni · persony narracyjne · duże modele językowe · przywiązanie · mentalizacja · psychometria polska

Pakiet danych i analizy

Depozyt archiwalny towarzyszący manuskryptowi: dane punktowane, bodźce, prompty i kod, którym policzono każdą tabelę. Regeneracja jedną komendą, na ustalonych ziarnach, z sumami kontrolnymi.

1156

przebiegi modeli

punktowane, z oznaczeniem fali

30

biografie narracyjne

po polsku, z profilem docelowym

1265

wywołania w manifeście audytu

SHA-256 promptu i odpowiedzi

v1.0.1

wersja depozytu

opublikowana 17.07.2026

Kod na licencji MIT, materiały autora na CC BY 4.0, pozycje narzędzi stron trzecich (DBZ-R, MentS-PL, KPP, TIPI-PL) wyłączone z licencjonowania i nieudostępniane dosłownie.

Żywe dane

Dane pod manuskryptem, przeliczane na żywo

Gęste polskie narracyjne biografie wywołują zgodne między modelami, uwarunkowane personą gradienty psychometryczne — nawet gdy bazowe samoopisy modeli różnią się mocno. Siedem modeli od czterech producentów — Sonnet, Opus, GPT-5.4-mini, GPT-5.4 (full), GPT-5.5, Grok, Gemini — 30 fikcyjnych biografii, 4 polskie narzędzia samoopisowe, 1 autorski test mentalizacji, 3 warunki obserwacji.

wiersze danych

545

źródło prawdy

biografie person

30

po polsku, autorskie

modele

7

4 producentów

warunki

3

persona · baseline · zero-prompt

persona424

ponad plan 30 × 7 × 2 — nadwyżka to zachowane powtórki

baseline70
zero-prompt44
człowiek (sanity check)7
Filtr modeli ·
(7/7 — pełny zestaw)
01

Sekcja

Czy narzędzia reagują na zaprojektowane zróżnicowanie?

Na skorygowanym bodźcu zgodność z kluczem TCTM-22 oddziela ludzki sanity check (M = 14,3) od siedmiu modeli (M = 18,2–20,9 w pierwszej administracji, 18,3–21,0 po uśrednieniu obu), z Sonnetem na samej górze. Profile kategorii dystraktorów pozostają jakościowo odrębne. W warunku bazowym oba Claude’y wybierają nie-klucz wyłącznie w kategorii hipomentalizacji (Sonnet 4,5%, Opus 9,1% DOS; zero NAD), a Gemini jako jedyny myli się głównie nadatrybucyjnie (5,0% NAD). Pod instrukcją persony profile się rozmywają: Sonnet 3,6% DOS i 1,1% NAD, Opus 10,5% i 1,4%.

Manuskrypt §3.1, tabele 2–3 · weryfikacja §2–3 · 51 sprawdzeń

0246810121416182022Trafność TCTM-22 (0–22 poprawnych)Humann=7dane zbiorcze (M ± zakres)M=14.3Sonnetn=30M=20.9Opusn=30M=19.2GPTn=30M=18.2GPT54n=30M=20.3GPT55n=30M=20.8Grokn=30M=20.2Geminin=30M=19.3
Human
±1.38
n=7 · 1216
Sonnet
±0.64
n=30 · 1922
Opus
±1.90
n=30 · 1021
GPT
±1.65
n=30 · 1521
GPT54
±1.32
n=30 · 1421
GPT55
±1.13
n=30 · 1622
Grok
±2.91
n=30 · 722
Gemini
±2.26
n=30 · 821

Klasyfikacja stylu przywiązania

Małe macierze konfuzji — wiersze to styl oczekiwany, kolumny styl przewidziany przez model. Przekątna to trafienia. Kliknięcie komórki pokazuje listę person, które w niej wylądowały.

Sonnet

n=30
acc
κ
Bezp.
Lęk.
Unik.
Zdez.
Bezp.
Lęk.
Unik.
Zdez.

Opus

n=30
acc
κ
Bezp.
Lęk.
Unik.
Zdez.
Bezp.
Lęk.
Unik.
Zdez.

GPT

n=30
acc
κ
Bezp.
Lęk.
Unik.
Zdez.
Bezp.
Lęk.
Unik.
Zdez.

GPT54

n=30
acc
κ
Bezp.
Lęk.
Unik.
Zdez.
Bezp.
Lęk.
Unik.
Zdez.

GPT55

n=30
acc
κ
Bezp.
Lęk.
Unik.
Zdez.
Bezp.
Lęk.
Unik.
Zdez.

Grok

n=30
acc
κ
Bezp.
Lęk.
Unik.
Zdez.
Bezp.
Lęk.
Unik.
Zdez.

Gemini

n=30
acc
κ
Bezp.
Lęk.
Unik.
Zdez.
Bezp.
Lęk.
Unik.
Zdez.

Persona × model — pełna mapa zgodności

30 person × 7 — 210. Zielony znacznik — styl przewidziany pokrywa się z oczekiwanym, czerwony — niezgodność. Kliknięcie komórki otwiera personę razem z surowym wyjściem modelu.

persona ↓ · model →
Sonnet
Opus
GPT
GPT54
GPT55
Grok
Gemini
expected
fea
sec
fea
sec
dis
anx
fea
sec
dis
anx
fea
dis
sec
fea
anx
sec
dis
fea
dis
anx
fea
dis
anx
dis
sec
anx
fea
anx
anx
sec
match / N
23/30 · 77%
25/30 · 83%
29/30 · 97%
26/30 · 87%
26/30 · 87%
26/30 · 87%
25/30 · 83%

Test-retest TCTM-22

Małe wykresy rozrzutu: oś X to wynik pierwszego przebiegu, oś Y drugiego. Im bliżej przekątnej, tym spójniejszy retest. Współczynnik Pearsona w lewym górnym rogu.

Sonnet

n=30
0011112222r = 0.83
z-score med r 0.99styl 29/30

Opus

n=30
0011112222r = 0.92
z-score med r 0.99styl 29/30

GPT

n=30
0011112222r = 0.42
z-score med r 0.96styl 29/30

GPT54

n=30
0011112222r = 0.90
z-score med r 0.99styl 29/30

GPT55

n=30
0011112222r = 0.90
z-score med r 0.99styl 30/30

Grok

n=30
0011112222r = 0.88
z-score med r 0.95styl 28/30

Gemini

n=30
0011112222r = 0.93
z-score med r 0.97styl 29/30

Korelacje rang oczekiwanych z wartościami obserwowanymi

Dla każdego modelu i każdego z 11 wymiarów samoopisowych liczymy Pearson r między rangą poziomu zaprojektowanego dla persony (bardzo niski → bardzo wysoki) a wartością zwróconą przez model. Mediana powyżej 0,7 oznacza silne odzyskanie zaprojektowanego konstruktu. Kliknięcie wiersza otwiera wykresy per wymiar.

-1.0-0.5+0.0+0.5+1.0Pearson r — ranga oczekiwana vs wartość obserwowanasilne +silne −brakSonnet11/11 wymiarówr +0.82ρ +0.82Opus11/11 wymiarówr +0.84ρ +0.84GPT11/11 wymiarówr +0.77ρ +0.78GPT5411/11 wymiarówr +0.80ρ +0.80GPT5511/11 wymiarówr +0.81ρ +0.83Grok11/11 wymiarówr +0.76ρ +0.75Gemini11/11 wymiarówr +0.76ρ +0.80

Per wymiar — siatka 11 wykresów rozrzutu

Tysiąc słów tabel skraca się do tej siatki: 11 paneli, jeden na wymiar samoopisowy, każda kropka to jedna persona w jednym modelu. Im bliżej prostej rosnącej, tym lepiej model odzyskał zaprojektowany porządek person. Najechanie na model w legendzie wyróżnia jego kropki we wszystkich panelach.

model:najechanie na legendę wyróżnia model · kliknięcie kropki otwiera personę

DBZ-R · lęk

med r = +0.90
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

DBZ-R · unikanie

med r = +0.86
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

MentS · siebie

med r = +0.62
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

MentS · innych

med r = +0.81
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

MentS · motywacji

med r = +0.71
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

KPP

med r = +0.72
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

TIPI · E

med r = +0.83
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

TIPI · A

med r = +0.76
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

TIPI · C

med r = +0.79
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

TIPI · ES

med r = +0.83
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

TIPI · O

med r = +0.84
-2-1+0+1+2
ranga oczekiwana →↑ obserwowane

Profile błędów TCTM-22 wg taksonomii MASC — trajektoria DOS / NAD / BK

Słupki skumulowane pokazują, jak rozkład trzech taksonomicznych typów błędu zmienia się dla każdego modelu między warunkami: persona (przebieg 1), baseline (model jako on sam) i zero-prompt (bez instrukcji systemowej). Kategorie dystraktorów przypisał autor według taksonomii MASC (Dziobek 2006); nie zostały niezależnie zaadjudykowane, więc to wielkości wierności bodźca, nie zwalidowane oszacowania trafności.

grupapersonabaselinezero-prompt
Human
Sonnet
Opus
GPT
GPT54
GPT55
Grok
Gemini
DOS — hipo-mentalizacjaNAD — nadmiernaBK — braktylko pierwszy przebieg persony; baseline i zero-prompt — wszystkie ważne

Oś DOS × NAD — pozycje strategii błędu

Każdy model w każdym warunku to jedna kropka na płaszczyźnie (DOS%, NAD%). Przekątna oznacza profil symetryczny, lewy dolny róg bezbłędność, prawy górny chaos. Brzegi sygnalizują dominację jednego typu błędu.

00252550507575100100DOS% (hipo-mentalizacja)NAD% (nadmierna)HumanSonnetSonnet·bSonnet·nOpusOpus·bOpus·nGPTGPT·bGPT·nGPT54GPT54·bGPT54·nGPT55GPT55·bGPT55·nGrokGrok·bGrok·nGeminiGemini·bGemini·n

Każda kropka to para (model × warunek). Kropka pełna to pierwszy przebieg persony, częściowa to baseline, najjaśniejsza to zero-prompt. Czerwona przekątna oznacza profil symetryczny (DOS = NAD).

Lewy dolny róg — oba wskaźniki niskie, czyli bezbłędność. Prawy górny — chaos. Brzegi sygnalizują dominację jednego typu błędu.

  • HumanDOS 32 · NAD 36
  • SonnetDOS 81 · NAD 19
  • OpusDOS 84 · NAD 9
  • GPTDOS 59 · NAD 13
  • GPT54DOS 27 · NAD 12
  • GPT55DOS 53 · NAD 44
  • GrokDOS 36 · NAD 35
  • GeminiDOS 18 · NAD 45

22 winiety × 7 modeli — taksonomia błędu na pozycję

Najgłębsza warstwa: każda komórka pokazuje rozkład correct / DOS / NAD / BK dla pary (winieta × model), zsumowany po 30 personach w pierwszym przebiegu warunku persona. Kliknięcie komórki otwiera szufladę z formułą i surowymi licznikami.

itemSonnetOpusGPTGPT54GPT55GrokGeminiLLM Σ
w01
s07
s08
s10
w08
c07
c10
w11
w13
w14
e08
w15
w19
pw07
w22
pw09
pw11
w25
r08
w28
r09
r10
correctDOS — hipomentalizacjaNAD — nadmiernaBK — brak210 przebiegów persona × model przetworzonych

Krzywa trudności pozycji

22 winiety na osi X, sortowane od najtrudniejszej dla człowieka. Krzywa dla każdego modelu plus przerywana linia człowieka (n = 7). Modele utrzymujące wysoką trafność na lewym krańcu osi, tam gdzie człowiek wypada najsłabiej, to wzorzec „trudne dla człowieka, łatwe dla modelu” — sygnał, że klucz autorski mówi po modelowemu.

0255075100w28c10w22c07s08r0822 winiety, od najtrudniejszej dla człowieka →trafność %
Człowiek (n = 7, linia przerywana)SonnetOpusGPTGPT54GPT55GrokGemini

Najlepiej i najgorzej dopasowane persony w każdym modelu

Po trzy persony z góry i z dołu dla każdego modelu, według średniej |z obserwowane − ranga oczekiwana| z dziewięciu wymiarów wystandaryzowanych. Pokazuje, które biografie dany model rozumie wzorowo, a które mu uciekają.

Sonnet
best — najmniejszy Σ|obs − exp|
najgorsze — największe Σ|obs − exp|
Opus
best — najmniejszy Σ|obs − exp|
najgorsze — największe Σ|obs − exp|
GPT
best — najmniejszy Σ|obs − exp|
najgorsze — największe Σ|obs − exp|
GPT54
best — najmniejszy Σ|obs − exp|
najgorsze — największe Σ|obs − exp|
GPT55
best — najmniejszy Σ|obs − exp|
najgorsze — największe Σ|obs − exp|
Grok
best — najmniejszy Σ|obs − exp|
najgorsze — największe Σ|obs − exp|
Gemini
best — najmniejszy Σ|obs − exp|
najgorsze — największe Σ|obs − exp|

Ranking trudności person

30 person od najtrudniejszej (najwyższa średnia |z − ranga| we wszystkich aktywnych modelach) do najłatwiejszej. Wysokie SD między modelami oznacza, że część modeli rozumie tę personę, a część ją mija.

#personastylśredni |Δz|SD per modelobs.
1marekZdez.
1.63
0.2363
2nataliaLęk.
1.15
0.1963
3dominikaUnik.
1.12
0.1563
4michal-simZdez.
1.11
0.1763
5piotrZdez.
1.05
0.0963
6radekZdez.
1.05
0.1563
7filipZdez.
1.01
0.1163
8klaudiaLęk.
0.98
0.1363
9michal-kLęk.
0.93
0.0863
10hubertUnik.
0.90
0.1363
11bartekLęk.
0.88
0.0863
12kamilZdez.
0.86
0.1263
13pawelLęk.
0.85
0.1663
14magdaUnik.
0.83
0.1663
15anna-simBezp.
0.80
0.1163
16adrianUnik.
0.79
0.1263
17jakubUnik.
0.78
0.2663
18tomekUnik.
0.78
0.1063
19agataUnik.
0.77
0.1063
20zuziaZdez.
0.77
0.1763
21saraBezp.
0.75
0.1363
22gabrielaLęk.
0.73
0.0763
23jolaLęk.
0.69
0.1363
24kubaBezp.
0.68
0.0563
25weronikaBezp.
0.64
0.1463
26olaBezp.
0.64
0.1863
27kasiaBezp.
0.57
0.0963
28ewaZdez.
0.57
0.0863
29lukaszBezp.
0.55
0.0963
30aniaLęk.
0.50
0.1163
02

Sekcja

Czy reakcja generalizuje się między producentami?

Na danych po korekcie siedem modeli tworzy jeden klaster: κ Fleissa = 0,853 (raportowana jako opisowa zgodność panelu — modele nie są niezależnymi sędziami), a wszystkie 21 par median korelacji profili person mieści się w przedziale [0,947; 0,989]. ICC i Q Cochrana poniżej liczą się na żywo dla aktywnego zestawu modeli; przełącz na zbiórkę wstępną, żeby zobaczyć, jak rozszczepiony wyglądał panel przed korektą bodźca.

Manuskrypt §3.2 · weryfikacja §6 · 4 sprawdzenia

7 modeli

wspólne n=30
ICC(2,1)

Spójność trafności TCTM-22 między modelami, liczona na przecięciu person, dla których wszystkie modele zwróciły kompletną odpowiedź.

SonnetOpusGPTGPT54GPT55GrokGemini

6 modeli (bez GPT-5.4 full)

wspólne n=30
ICC(2,1)

Spójność trafności TCTM-22 między modelami, liczona na przecięciu person, dla których wszystkie modele zwróciły kompletną odpowiedź.

SonnetOpusGPTGPT55GrokGemini

5 modeli (bez GPT-5.5 i GPT-5.4 full)

wspólne n=30
ICC(2,1)

Spójność trafności TCTM-22 między modelami, liczona na przecięciu person, dla których wszystkie modele zwróciły kompletną odpowiedź.

SonnetOpusGPTGrokGemini

4 modele (bez żadnego GPT)

wspólne n=30
ICC(2,1)

Spójność trafności TCTM-22 między modelami, liczona na przecięciu person, dla których wszystkie modele zwróciły kompletną odpowiedź.

SonnetOpusGrokGemini

κ Fleissa — zgodność klasyfikacji stylu

κ Fleissa rozszerza κ Cohena na więcej niż dwóch sędziów. Mierzy zgodność aktywnych modeli w przypisywaniu personie etykiety stylu przywiązania, skorygowaną o zgodność, jakiej można oczekiwać samym przypadkiem: 0 to poziom losowy, 1 to pełna jednomyślność.

7 modeli

wspólne n=30
Fleiss κprawie idealna
SonnetOpusGPTGPT54GPT55GrokGemini

Q Cochrana na pozycję (22 winiety TCTM)

Test Cochrana sprawdza, czy proporcje sukcesu różnią się istotnie między modelami na każdej z 22 pozycji TCTM-22. Zielone — istotne po korekcie Bonferroniego, żółte — po BH FDR. Kliknięcie kropki pokazuje rozbicie trafności modeli dla danej winiety. Wartości przeliczają się na żywo przy zmianie filtra.

p < .0513/22
Bonferroni p < .002310/22
BH FDR q < .0512/22
10.10.050.010.0011e-41e-51e-6α=.05Bonfwartość p (skala logarytmiczna) — niżej oznacza większą niezgodność między modelamis07Q=127.9w15Q=122.9pw07Q=91.3w22Q=90.0w11Q=81.0w19Q=57.3w28Q=50.4r10Q=48.9w01Q=28.6e08Q=21.5w14Q=20.1pw09Q=18.0w08Q=13.0w13Q=9.3r09Q=8.7s08Q=6.0s10Q=6.0c10Q=6.0r08Q=6.0w25Q=4.0c07Q=0.0pw11Q=0.0

Konwergencja TCTM × MentS-Total

Jeśli TCTM-22 i MentS-PL mierzą tę samą mentalizację, w obrębie modelu spodziewamy się korelacji dodatniej. Empirycznie wyniki są słabe i niespójne, co sugeruje różne konstrukty — albo że klucz autorski TCTM mierzy coś innego niż intuicja modelu.

Sonnet

n=30
509514001122r = -0.07
MentS →TCTM ↑

Opus

n=30
509514001122r = +0.16
MentS →TCTM ↑

GPT

n=30
509514001122r = -0.36
MentS →TCTM ↑

GPT54

n=30
509514001122r = +0.10
MentS →TCTM ↑

GPT55

n=30
509514001122r = +0.24
MentS →TCTM ↑

Grok

n=30
509514001122r = +0.31
MentS →TCTM ↑

Gemini

n=30
509514001122r = -0.04
MentS →TCTM ↑

Per-item TCTM-22 — człowiek vs model

22 winiety osobno: trafność człowieka (n = 7) i każdego aktywnego modelu, domyślnie sortowane po Δ (średnia modeli − człowiek). Duże dodatnie Δ to pozycje, które modele rozwiązują znacznie lepiej niż ludzie.

SonnetOpusGPTGPT54GPT55GrokGemini
w2814%(1/7)100539393936710086+71
w1929%(2/7)10077938353974378+50
pw0743%(3/7)1001004397100979790+48
c1057%(4/7)1009710097100979798+41
w2557%(4/7)9797100100100979798+41
w0857%(4/7)10097100100100909798+40
w1357%(4/7)1009093100100979797+40
e0857%(4/7)100978397100979796+39
r1057%(4/7)9797639393979791+34
w1557%(4/7)10097271001009710089+31
pw0971%(5/7)1001001001001009010099+27
r0971%(5/7)100100931001009710099+27
c0771%(5/7)1009710097979710098+27
pw1186%(6/7)100100100100100100100100+14
r0886%(6/7)10010097100100100100100+14
s0886%(6/7)10010010010010097100100+14
s1086%(6/7)10010010010010097100100+14
w1171%(5/7)10010077100100833385+13
w1486%(6/7)8397977797909791+5
s0771%(5/7)1002779797879072+0
w01100%(7/7)100977710097939794-6
w2257%(4/7)1708305357731-26
komórka modelu: powyżej człowieka o 5+ ppponiżej człowieka o 5+ ppΔ duża dodatnia (łatwiejsze dla modelu niż dla człowieka)

Krzywa kumulacyjnej trafności

Pozycje sortowane rosnąco po trafności człowieka; oś Y to średnia krocząca trafności na pierwszych k pozycjach. Linie modeli rozjeżdżają się z linią człowieka tam, gdzie różnice są największe.

0%25%50%75%100%22 winiety, od najtrudniejszej dla człowieka →trafność kumulacyjna %
Człowiek (linia przerywana)SonnetOpusGPTGPT54GPT55GrokGemini

Korelacje między 22 pozycjami TCTM

Macierz 22 × 22 — współczynnik Pearsona między wynikami binarnymi (1 = trafienie, 0 = pudło) na pozycję. Bloki ciepłych pól sugerują grupy pozycji o wspólnej strukturze sukcesu i porażki, czyli przybliżenie struktury czynnikowej.

w01s07s08s10w08c07c10w11w13w14e08w15w19pw07w22pw09pw11w25r08w28r09r10
w01
s07
s08
s10
w08
c07
c10
w11
w13
w14
e08
w15
w19
pw07
w22
pw09
pw11
w25
r08
w28
r09
r10
N = 204 / 210tylko kompletne przypadki — przebiegi z brakiem choć jednej z 22 pozycji są pomijane
−1
+1
r = Pearson (φ) na odpowiedziach 0/1 · konserwatywne przybliżenie tetrachorycznej

Dyspersja retestu |Δz| na skalę

Dla każdej z dziewięciu skal wystandaryzowanych: rozkład |z(przebieg 1) − z(przebieg 2)| w każdym modelu jako mini wykres pudełkowy. Mniejsza mediana oznacza bardziej deterministyczny retest. Czerwona linia przerywana odpowiada granicy 0,5 SD.

lęk (DBZ-R)
0.000.250.500.751.00Sonnetn=30Opusn=30GPTn=30GPT54n=30GPT55n=30Grokn=30Geminin=30
unik. (DBZ-R)
0.000.250.500.751.00Sonnetn=30Opusn=30GPTn=30GPT54n=30GPT55n=30Grokn=30Geminin=30
MentS Σ
0.000.250.500.751.00Sonnetn=30Opusn=30GPTn=30GPT54n=30GPT55n=30Grokn=30Geminin=30
KPP
0.000.250.500.751.00Sonnetn=30Opusn=30GPTn=30GPT54n=30GPT55n=30Grokn=30Geminin=30
TIPI E
0.000.250.500.751.00Sonnetn=30Opusn=30GPTn=30GPT54n=30GPT55n=30Grokn=30Geminin=30
TIPI A
0.000.250.500.751.00Sonnetn=30Opusn=30GPTn=30GPT54n=30GPT55n=30Grokn=30Geminin=30
TIPI C
0.000.250.500.751.00Sonnetn=30Opusn=30GPTn=30GPT54n=30GPT55n=30Grokn=30Geminin=30
TIPI ES
0.000.250.500.751.00Sonnetn=30Opusn=30GPTn=30GPT54n=30GPT55n=30Grokn=30Geminin=30
TIPI O
0.000.250.500.751.00Sonnetn=30Opusn=30GPTn=30GPT54n=30GPT55n=30Grokn=30Geminin=30
03

Sekcja

Skąd bierze się obserwowana wariancja odpowiedzi?

Profile bazowe „jako Ty — model” dzielą wspólną sygnaturę aprobaty społecznej (lęk głęboko poniżej polskiej normy, mentalizacja i potrzeba poznania wysoko powyżej), ale różnią się między modelami nawet o 1,7 SD na polskich normach — najszerzej na unikaniu, ekstrawersji i ugodowości. Wykresy poniżej liczą przesunięcia i wariancję na żywo dla aktywnego zestawu.

Manuskrypt §3.3, tabela 7 · weryfikacja §5 · 20 sprawdzeń

DBZ-R · lęk

Δ noprompt − baseline

DBZ-R · unikanie

Δ noprompt − baseline

MentS · suma

Δ noprompt − baseline

TIPI · stab. emoc.

Δ noprompt − baseline

Warunek bazowy — sygnatura modelu „jako siebie”

Co zwracają modele poproszone o wypełnienie baterii jako one same? Każdy ma stabilną sygnaturę odpowiedzi w nieobecności persony. Ostatnia kolumna to d Cohena dla MentS persona vs baseline (kliknięcie otwiera pełne rozbicie).

modelnstyl dominującyANXAVOMentSKPPTCTM M ± SDTIPI-ESd / g MentS persona vs baseline
Sonnet
10Unik.2.114.101224.7421.0 ± 0.005.4
Opus
10Bezp.2.232.791294.6820.0 ± 0.005.3
GPT
10Bezp.1.693.021314.9619.1 ± 1.106.3
GPT54
10Bezp.1.483.541234.9220.8 ± 0.427.0
GPT55
10Bezp.1.263.421284.8921.8 ± 0.427.0
Grok
10Bezp.1.762.421324.8721.6 ± 0.706.5
Gemini
10Bezp.1.022.771364.9919.9 ± 0.327.0

Wariancja persona / baseline

O ile instrukcja persony rozszerza wariancję odpowiedzi względem warunku bazowego? Mediana 3,5×–8,9× przekonuje, że biografie faktycznie generują różne profile, a nie że model sprowadza je do jednej wartości domyślnej.

1×2×5×10×15×SD persony / SD baseline (11 wymiarów)Sonnetn=11 dimsmed 6.6×Opusn=8 dimsmed 7.3×GPTn=11 dimsmed 3.8×GPT54n=10 dimsmed 3.3×GPT55n=9 dimsmed 7.1×Grokn=11 dimsmed 4.4×Geminin=10 dimsmed 4.2×1× (równa)

Kotwiczenie w normach — odległość od polskich norm populacyjnych

Dla każdej skali samoopisowej, każdego modelu i każdego z trzech warunków: odległość obserwowanej średniej od polskiej normy populacyjnej w jednostkach SD normy. Pas ±1 SD to przedział odpowiedzi typowej. Źródła norm: Lubiewska 2016 (DBZ-R), Jańczak 2021 (MentS-PL), Matusz 2011 (KPP), Sorokowska 2014 (TIPI-PL).

Sonnet
Opus
GPT
GPT54
GPT55
Grok
Gemini

MentS — podskale Self / Other / Motivation na personę i model

Trzy paski w wierszu pokazują rozkład samoopisowej mentalizacji na podskale. Pionowa biała kreska na każdym pasku to mediana polskiej normy. Kliknięcie wiersza otwiera pełne rozbicie z sumą wystandaryzowaną.

Norma PL: Self M = 27,9, Other M = 38,2, Motivation M = 38,8 (Jańczak 2021, N = 431) · suma M = 105,0.
personamodelselfothermotivationΣ vs norma
adrianSonnet
21
30
34
85 (-1.5 σ)
adrianOpus
24
28
29
81 (-1.8 σ)
adrianGPT
19
36
41
96 (-0.7 σ)
adrianGPT54
17
27
33
77 (-2.0 σ)
adrianGPT55
19
29
28
76 (-2.1 σ)
adrianGrok
22
35
38
95 (-0.7 σ)
adrianGemini
19
28
35
82 (-1.7 σ)
agataSonnet
32
40
42
114 (+0.7 σ)
agataOpus
38
40
43
121 (+1.2 σ)
agataGPT
34
42
45
121 (+1.2 σ)
agataGPT54
34
39
41
114 (+0.7 σ)
agataGPT55
34
41
40
115 (+0.7 σ)
agataGrok
31
42
46
119 (+1.0 σ)
agataGemini
36
40
38
114 (+0.7 σ)
aniaSonnet
26
42
49
117 (+0.9 σ)
aniaOpus
30
40
48
118 (+0.9 σ)
aniaGPT
25
41
48
114 (+0.7 σ)
aniaGPT54
35
42
49
126 (+1.5 σ)
aniaGPT55
34
42
49
125 (+1.5 σ)
aniaGrok
30
47
48
125 (+1.5 σ)
aniaGemini
27
41
49
117 (+0.9 σ)
anna-simSonnet
28
39
34
101 (-0.3 σ)
anna-simOpus
32
41
32
105 (+0.0 σ)
anna-simGPT
32
45
44
121 (+1.2 σ)
anna-simGPT54
26
42
26
94 (-0.8 σ)
anna-simGPT55
31
42
26
99 (-0.4 σ)
anna-simGrok
28
44
40
112 (+0.5 σ)
anna-simGemini
31
45
38
114 (+0.7 σ)
bartekSonnet
27
41
48
116 (+0.8 σ)
bartekOpus
31
40
47
118 (+0.9 σ)
bartekGPT
26
44
48
118 (+0.9 σ)
bartekGPT54
35
42
48
125 (+1.5 σ)
bartekGPT55
32
42
48
122 (+1.2 σ)
bartekGrok
32
45
49
126 (+1.5 σ)
bartekGemini
22
41
48
111 (+0.4 σ)
dominikaSonnet
21
45
43
109 (+0.3 σ)
dominikaOpus
30
47
43
120 (+1.1 σ)
dominikaGPT
21
48
47
116 (+0.8 σ)
dominikaGPT54
18
44
44
106 (+0.1 σ)
dominikaGPT55
20
43
41
104 (-0.1 σ)
dominikaGrok
29
46
48
123 (+1.3 σ)
dominikaGemini
25
47
45
117 (+0.9 σ)
ewaSonnet
25
46
48
119 (+1.0 σ)
ewaOpus
32
44
49
125 (+1.5 σ)
ewaGPT
30
49
50
129 (+1.8 σ)
ewaGPT54
28
43
48
119 (+1.0 σ)
ewaGPT55
30
48
49
127 (+1.6 σ)
ewaGrok
33
49
48
130 (+1.8 σ)
ewaGemini
29
47
48
124 (+1.4 σ)
filipSonnet
24
40
46
110 (+0.4 σ)
filipOpus
28
44
48
120 (+1.1 σ)
filipGPT
21
46
49
116 (+0.8 σ)
filipGPT54
26
41
47
114 (+0.7 σ)
filipGPT55
25
43
48
116 (+0.8 σ)
filipGrok
20
44
47
111 (+0.4 σ)
filipGemini
23
41
48
112 (+0.5 σ)
gabrielaSonnet
26
41
46
113 (+0.6 σ)
gabrielaOpus
29
41
47
117 (+0.9 σ)
gabrielaGPT
25
46
45
116 (+0.8 σ)
gabrielaGPT54
27
43
47
117 (+0.9 σ)
gabrielaGPT55
28
43
47
118 (+0.9 σ)
gabrielaGrok
22
44
46
112 (+0.5 σ)
gabrielaGemini
33
45
47
125 (+1.5 σ)
hubertSonnet
18
31
35
84 (-1.5 σ)
hubertOpus
18
26
31
75 (-2.2 σ)
hubertGPT
18
39
45
102 (-0.2 σ)
hubertGPT54
16
26
34
76 (-2.1 σ)
hubertGPT55
20
24
34
78 (-2.0 σ)
hubertGrok
12
33
41
86 (-1.4 σ)
hubertGemini
14
26
34
74 (-2.3 σ)
jakubSonnet
25
36
30
91 (-1.0 σ)
jakubOpus
31
36
29
96 (-0.7 σ)
jakubGPT
25
39
43
107 (+0.1 σ)
jakubGPT54
26
37
25
88 (-1.2 σ)
jakubGPT55
30
35
25
90 (-1.1 σ)
jakubGrok
15
32
31
78 (-2.0 σ)
jakubGemini
34
39
31
104 (-0.1 σ)
jolaSonnet
26
49
48
123 (+1.3 σ)
jolaOpus
32
47
50
129 (+1.8 σ)
jolaGPT
28
49
50
127 (+1.6 σ)
jolaGPT54
32
47
49
128 (+1.7 σ)
jolaGPT55
30
47
50
127 (+1.6 σ)
jolaGrok
24
46
48
118 (+0.9 σ)
jolaGemini
29
46
50
125 (+1.5 σ)
kamilSonnet
25
37
38
100 (-0.4 σ)
kamilOpus
25
38
38
101 (-0.3 σ)
kamilGPT
21
41
44
106 (+0.1 σ)
kamilGPT54
21
39
43
103 (-0.1 σ)
kamilGPT55
26
39
42
107 (+0.1 σ)
kamilGrok
16
38
44
98 (-0.5 σ)
kamilGemini
25
39
44
108 (+0.2 σ)
kasiaSonnet
38
48
50
136 (+2.3 σ)
kasiaOpus
39
47
48
134 (+2.1 σ)
kasiaGPT
37
49
49
135 (+2.2 σ)
kasiaGPT54
39
46
50
135 (+2.2 σ)
kasiaGPT55
40
47
50
137 (+2.3 σ)
kasiaGrok
31
50
48
129 (+1.8 σ)
kasiaGemini
37
49
50
136 (+2.3 σ)
klaudiaSonnet
24
45
46
115 (+0.7 σ)
klaudiaOpus
29
46
46
121 (+1.2 σ)
klaudiaGPT
25
44
46
115 (+0.7 σ)
klaudiaGPT54
21
46
46
113 (+0.6 σ)
klaudiaGPT55
19
48
48
115 (+0.7 σ)
klaudiaGrok
23
49
47
119 (+1.0 σ)
klaudiaGemini
24
46
45
115 (+0.7 σ)
kubaSonnet
34
44
49
127 (+1.6 σ)
kubaOpus
34
43
50
127 (+1.6 σ)
kubaGPT
34
48
50
132 (+2.0 σ)
kubaGPT54
34
44
49
127 (+1.6 σ)
kubaGPT55
35
44
50
129 (+1.8 σ)
kubaGrok
31
45
49
125 (+1.5 σ)
kubaGemini
33
46
49
128 (+1.7 σ)
lukaszSonnet
24
39
43
106 (+0.1 σ)
lukaszOpus
26
40
42
108 (+0.2 σ)
lukaszGPT
27
44
47
118 (+0.9 σ)
lukaszGPT54
28
42
47
117 (+0.9 σ)
lukaszGPT55
30
43
47
120 (+1.1 σ)
lukaszGrok
30
43
46
119 (+1.0 σ)
lukaszGemini
27
45
49
121 (+1.2 σ)
magdaSonnet
25
37
42
104 (-0.1 σ)
magdaOpus
26
39
37
102 (-0.2 σ)
magdaGPT
28
40
45
113 (+0.6 σ)
magdaGPT54
20
38
42
100 (-0.4 σ)
magdaGPT55
23
40
40
103 (-0.1 σ)
magdaGrok
21
44
45
110 (+0.4 σ)
magdaGemini
31
42
45
118 (+0.9 σ)
marekSonnet
17
21
22
60 (-3.3 σ)
marekOpus
18
24
27
69 (-2.6 σ)
marekGPT
12
22
22
56 (-3.6 σ)
marekGPT54
11
23
21
55 (-3.6 σ)
marekGPT55
11
23
21
55 (-3.6 σ)
marekGrok
11
23
24
58 (-3.4 σ)
marekGemini
13
24
20
57 (-3.5 σ)
michal-kSonnet
26
39
45
110 (+0.4 σ)
michal-kOpus
29
40
46
115 (+0.7 σ)
michal-kGPT
25
45
47
117 (+0.9 σ)
michal-kGPT54
26
41
47
114 (+0.7 σ)
michal-kGPT55
25
39
47
111 (+0.4 σ)
michal-kGrok
22
42
47
111 (+0.4 σ)
michal-kGemini
23
41
47
111 (+0.4 σ)
michal-simSonnet
17
35
38
90 (-1.1 σ)
michal-simOpus
23
31
36
90 (-1.1 σ)
michal-simGPT
15
40
43
98 (-0.5 σ)
michal-simGPT54
16
35
37
88 (-1.2 σ)
michal-simGPT55
16
38
37
91 (-1.0 σ)
michal-simGrok
15
35
36
86 (-1.4 σ)
michal-simGemini
16
31
38
85 (-1.5 σ)
nataliaSonnet
14
29
27
70 (-2.6 σ)
nataliaOpus
17
27
32
76 (-2.1 σ)
nataliaGPT
17
29
27
73 (-2.3 σ)
nataliaGPT54
14
28
27
69 (-2.6 σ)
nataliaGPT55
13
30
30
73 (-2.3 σ)
nataliaGrok
11
25
26
62 (-3.1 σ)
nataliaGemini
14
25
29
68 (-2.7 σ)
olaSonnet
29
36
27
92 (-0.9 σ)
olaOpus
30
35
27
92 (-0.9 σ)
olaGPT
34
36
31
101 (-0.3 σ)
olaGPT54
27
35
24
86 (-1.4 σ)
olaGPT55
30
34
24
88 (-1.2 σ)
olaGrok
16
37
28
81 (-1.8 σ)
olaGemini
30
46
37
113 (+0.6 σ)
pawelSonnet
17
32
29
78 (-2.0 σ)
pawelOpus
18
28
28
74 (-2.3 σ)
pawelGPT
19
39
41
99 (-0.4 σ)
pawelGPT54
16
35
33
84 (-1.5 σ)
pawelGPT55
16
38
33
87 (-1.3 σ)
pawelGrok
0
38
30
68 (-2.7 σ)
pawelGemini
27
40
37
104 (-0.1 σ)
piotrSonnet
16
30
35
81 (-1.8 σ)
piotrOpus
18
30
34
82 (-1.7 σ)
piotrGPT
16
37
39
92 (-0.9 σ)
piotrGPT54
14
38
39
91 (-1.0 σ)
piotrGPT55
14
36
41
91 (-1.0 σ)
piotrGrok
11
31
36
78 (-2.0 σ)
piotrGemini
12
27
38
77 (-2.0 σ)
radekSonnet
17
41
34
92 (-0.9 σ)
radekOpus
19
41
37
97 (-0.6 σ)
radekGPT
21
44
44
109 (+0.3 σ)
radekGPT54
14
43
40
97 (-0.6 σ)
radekGPT55
13
44
42
99 (-0.4 σ)
radekGrok
11
42
37
90 (-1.1 σ)
radekGemini
13
42
34
89 (-1.2 σ)
saraSonnet
32
47
47
126 (+1.5 σ)
saraOpus
32
46
44
122 (+1.2 σ)
saraGPT
37
49
47
133 (+2.0 σ)
saraGPT54
32
47
46
125 (+1.5 σ)
saraGPT55
34
48
47
129 (+1.8 σ)
saraGrok
33
50
47
130 (+1.8 σ)
saraGemini
30
48
48
126 (+1.5 σ)
tomekSonnet
18
44
41
103 (-0.1 σ)
tomekOpus
22
44
42
108 (+0.2 σ)
tomekGPT
13
45
45
103 (-0.1 σ)
tomekGPT54
15
43
42
100 (-0.4 σ)
tomekGPT55
16
42
41
99 (-0.4 σ)
tomekGrok
16
41
45
102 (-0.2 σ)
tomekGemini
20
41
43
104 (-0.1 σ)
weronikaSonnet
33
45
48
126 (+1.5 σ)
weronikaOpus
33
43
46
122 (+1.2 σ)
weronikaGPT
34
49
48
131 (+1.9 σ)
weronikaGPT54
33
47
48
128 (+1.7 σ)
weronikaGPT55
33
47
47
127 (+1.6 σ)
weronikaGrok
33
49
48
130 (+1.8 σ)
weronikaGemini
33
47
48
128 (+1.7 σ)
zuziaSonnet
25
45
46
116 (+0.8 σ)
zuziaOpus
32
47
49
128 (+1.7 σ)
zuziaGPT
29
47
50
126 (+1.5 σ)
zuziaGPT54
29
47
47
123 (+1.3 σ)
zuziaGPT55
29
47
47
123 (+1.3 σ)
zuziaGrok
31
49
46
126 (+1.5 σ)
zuziaGemini
19
45
46
110 (+0.4 σ)

ANOVA jednoczynnikowa — czy warunki różnią się istotnie?

Dla każdej pary (model × skala) statystyka F porównuje średnie persona / baseline / zero-prompt. Kropka kolorowana według pasa istotności (p < 0,001 / 0,01 / 0,05). Wartość p liczona z transformacji Wilsona-Hilferty’ego.

model skalaDBZ-R lękDBZ-R unikanieMentS ΣKPPTIPI ETIPI ATIPI CTIPI ESTIPI O
Sonnet
Opus
GPT
GPT54
GPT55
Grok
Gemini
p < .001p < .01p < .05nieistotnePrzybliżenie p z transformacji Wilsona-Hilferty’ego

Macierz d Cohena dla par modeli na skalę

Siatka wszystkich aktywnych modeli — wielkość efektu między każdą parą na danej skali samoopisowej w pierwszym przebiegu warunku persona. Kliknięcie komórki pokazuje g Hedgesa (z korektą obciążenia) oraz N obu grup.

SonnetOpusGPTGPT54GPT55GrokGemini
Sonnet
Opus
GPT
GPT54
GPT55
Grok
Gemini
d < 0 oznacza, że wiersz jest niżej niż kolumna · |d| > 0,8 to efekt duży, około 0,5 średni, < 0,2 mały · g Hedgesa w szufladzie
04

Sekcja

Meta — moc próby i pewność klasyfikacji

Czy obserwowane efekty mają wystarczające N? Czy klasyfikacje stylu przywiązania są pewne, czy graniczne? Trzy wykresy meta-poziomu zamykają argument o jakości badania.

Manuskrypt §3.4 · dyskusja §A.2

Macierz analizy mocy

Dla każdej pary (model × skala): obserwowane d Cohena oraz minimalne N na grupę potrzebne do wykrycia d ∈ {0,5; 0,8; 1,0} przy α = 0,05 i mocy 80%. Czerwone — niewykrywalne przy obecnym N, zielone — wykrywalne i duże.

model skalaDBZ-R lękDBZ-R unikanieMentS ΣKPPTIPI ETIPI ATIPI CTIPI ESTIPI O
Sonnet
Opus
GPT
GPT54
GPT55
Grok
Gemini
wykrywalne, |d| ≥ 0,8wykrywalne, mniejszy efektniewykrywalne przy obecnym Nα=.05 dwustronnie, moc 80% (z + Beasley-Springer)

Rzetelność wewnętrzna — α Cronbacha na skalę i model

Czy model odpowiada na 36 pozycji DBZ-R spójnie, czy chaotycznie? α Cronbacha liczona na poziomie POZYCJI, z odwróceniem punktacji zgodnym z procedurą przygotowania danych. Niska α nie oznacza, że odpowiedzi są błędne — oznacza, że bateria nie tworzy u tego modelu spójnej skali. Klucz: ≥ 0,90 doskonała · ≥ 0,70 akceptowalna · < 0,50 niedostateczna · < 0 odwrócona.

skala modelSonnetOpusGPTGPT54GPT55GrokGemini
DBZ-R · lęk
DBZ-R · unikanie
MentS · suma
KPP
α ≥ .90 doskonała.70 ≤ α < .90 akceptowalna.50 ≤ α < .70 wątpliwaα < .50 niedostatecznaα < 0 odwrócona

Pewność klasyfikacji stylu

Dla każdej pary persona × model: margines = min(|średnia lęku − 4|, |średnia unikania − 4|), czyli odległość od progu decyzyjnego. Wysokie mediany to pewni klasyfikatorzy; liczba przypadków granicznych (margines < 0,5) to miara wahania modelu.

Margines = min(|średnia lęku − 4|, |średnia unikania − 4|) — próg klasyfikacji stylu. Wartość < 0,5 oznacza decyzję graniczną.

Status danych

skorygowana (fale 3–4, poprawione renderowanie bodźca — podstawa manuskryptu). Wszystkie wykresy używają aktywnego zestawu modeli z paska na górze. Wykresy per model filtrują render, wartości międzyproducenckie (ICC, Q Cochrana, κ Fleissa) przeliczają się z surowych danych. Filtr zapisuje się w adresie URL, więc widok da się udostępnić linkiem.

eks

Używamy plików cookie do analizy ruchu (Google Analytics 4, PostHog) i wykrywania błędów (Sentry). Zbieramy dane o urządzeniu, przeglądarce i odwiedzanych podstronach. Treści twoich rozmów zostają na urządzeniu. Polityka prywatności