Manuskrypt · strona towarzysząca
Baseline Intercepts Versus Persona Slopes: Stimulus and Administration Fidelity of Polish Narrative-Biography Personas in Large Language Models
Bazowe punkty przecięcia a nachylenia person: wierność bodźca i wierność administracji polskich person narracyjno-biograficznych w dużych modelach językowych
czerwiec 2026 · rewizja PDF 17.07.2026
Abstrakt
Duże modele językowe są coraz częściej używane jako zamienniki respondentów, ale dotychczasowe prace raportują silne obciążenie aprobatą społeczną i słabą wierność psychometryczną na poziomie jednostki przy krótkich promptach demograficznych. To badanie testuje reżim gęstszy: 30 polskich narracyjnych biografii pisanych w drugiej osobie (1489–2861 słów), z których każda koduje z góry ustalony profil 12 wymiarów, podanych siedmiu modelom od czterech producentów w warunkach persona, baseline i zero-prompt, z pięcioma narzędziami. Wyłaniają się cztery ustalenia. Po pierwsze, odpowiedzi uwarunkowane personą zgadzają się z celami zadeklarowanymi przez autora (styl przywiązania: κ Cohena = 0,69–0,96; κ Fleissa dla siedmiu modeli = 0,85). Ponieważ cele i klucz TCTM-22 są zdefiniowane przez autora i nie zostały niezależnie zwalidowane, są to wielkości wierności bodźca, nie oszacowania zwalidowanej trafności. Po drugie, odpowiadanie rozdziela się na kruche punkty przecięcia (poziomy) i przenośne nachylenia person (relatywne odwzorowania profilu i przyrosty): bazowe wyniki modeli różnią się nawet o 1,7 SD na polskich normach, a mimo to wszystkie 21 median korelacji profili między modelami przekracza 0,94. Po trzecie, zamrożenia odpowiedzi w oknie wdrożeniowym, opisowo bimodalna komórka post hoc (N = 31) i wielosigmowe przesunięcie bazowe zachodzą na osi poziomu, podczas gdy odwzorowania person replikują się przy medianie r ≥ 0,92. Po czwarte, naprawiona usterka renderowania bodźca i obciążone porównanie składu baterii pokazują, że zgodność z kluczem na poziomie pozycji zmienia się nawet o 98 punktów procentowych, gdy wyniki zagregowane pozostają porównywalnie stabilne. Wyniki motywują raportowanie wierności bodźca i administracji obok wyników z modelem w roli respondenta.
Tłumaczenie autorskie. Wersją wiążącą jest abstrakt w manuskrypcie (angielski).
Słowa kluczowerespondenci syntetyczni · persony narracyjne · duże modele językowe · przywiązanie · mentalizacja · psychometria polska
Pakiet danych i analizy
Depozyt archiwalny towarzyszący manuskryptowi: dane punktowane, bodźce, prompty i kod, którym policzono każdą tabelę. Regeneracja jedną komendą, na ustalonych ziarnach, z sumami kontrolnymi.
1156
przebiegi modeli
punktowane, z oznaczeniem fali
30
biografie narracyjne
po polsku, z profilem docelowym
1265
wywołania w manifeście audytu
SHA-256 promptu i odpowiedzi
v1.0.1
wersja depozytu
opublikowana 17.07.2026
Kod na licencji MIT, materiały autora na CC BY 4.0, pozycje narzędzi stron trzecich (DBZ-R, MentS-PL, KPP, TIPI-PL) wyłączone z licencjonowania i nieudostępniane dosłownie.
Sekcje towarzyszące
Warstwy pod manuskryptem: materiał, procedura i droga każdej liczby od surowego pliku do tabeli.
- Persony→30 narracyjnych biografii z zadeklarowanym profilem 12 wymiarów.
- TCTM-57→Rozszerzona bateria 57 winiet i efekt kontekstu administracji.
- Genealogia→Każda liczba ma ścieżkę: surowy plik → parsowanie → punktacja → agregat.
- Metodologia→Bodziec, bateria, procedura zbierania, decyzje analityczne.
- Glosariusz→κ, ICC, DOS/NAD/BK i reszta aparatu — po ludzku.
- Praca magisterska→Osobny dokument: pełny tekst pracy w 23 plikach LaTeX.
Żywe dane
Dane pod manuskryptem, przeliczane na żywo
Gęste polskie narracyjne biografie wywołują zgodne między modelami, uwarunkowane personą gradienty psychometryczne — nawet gdy bazowe samoopisy modeli różnią się mocno. Siedem modeli od czterech producentów — Sonnet, Opus, GPT-5.4-mini, GPT-5.4 (full), GPT-5.5, Grok, Gemini — 30 fikcyjnych biografii, 4 polskie narzędzia samoopisowe, 1 autorski test mentalizacji, 3 warunki obserwacji.
wiersze danych
545
źródło prawdy
biografie person
30
po polsku, autorskie
modele
7
4 producentów
warunki
3
persona · baseline · zero-prompt
ponad plan 30 × 7 × 2 — nadwyżka to zachowane powtórki
Sekcja
Czy narzędzia reagują na zaprojektowane zróżnicowanie?
Na skorygowanym bodźcu zgodność z kluczem TCTM-22 oddziela ludzki sanity check (M = 14,3) od siedmiu modeli (M = 18,2–20,9 w pierwszej administracji, 18,3–21,0 po uśrednieniu obu), z Sonnetem na samej górze. Profile kategorii dystraktorów pozostają jakościowo odrębne. W warunku bazowym oba Claude’y wybierają nie-klucz wyłącznie w kategorii hipomentalizacji (Sonnet 4,5%, Opus 9,1% DOS; zero NAD), a Gemini jako jedyny myli się głównie nadatrybucyjnie (5,0% NAD). Pod instrukcją persony profile się rozmywają: Sonnet 3,6% DOS i 1,1% NAD, Opus 10,5% i 1,4%.
Manuskrypt §3.1, tabele 2–3 · weryfikacja §2–3 · 51 sprawdzeń
Klasyfikacja stylu przywiązania
Małe macierze konfuzji — wiersze to styl oczekiwany, kolumny styl przewidziany przez model. Przekątna to trafienia. Kliknięcie komórki pokazuje listę person, które w niej wylądowały.
Sonnet
Opus
GPT
GPT54
GPT55
Grok
Gemini
Persona × model — pełna mapa zgodności
30 person × 7 — 210. Zielony znacznik — styl przewidziany pokrywa się z oczekiwanym, czerwony — niezgodność. Kliknięcie komórki otwiera personę razem z surowym wyjściem modelu.
Test-retest TCTM-22
Małe wykresy rozrzutu: oś X to wynik pierwszego przebiegu, oś Y drugiego. Im bliżej przekątnej, tym spójniejszy retest. Współczynnik Pearsona w lewym górnym rogu.
Sonnet
Opus
GPT
GPT54
GPT55
Grok
Gemini
Korelacje rang oczekiwanych z wartościami obserwowanymi
Dla każdego modelu i każdego z 11 wymiarów samoopisowych liczymy Pearson r między rangą poziomu zaprojektowanego dla persony (bardzo niski → bardzo wysoki) a wartością zwróconą przez model. Mediana powyżej 0,7 oznacza silne odzyskanie zaprojektowanego konstruktu. Kliknięcie wiersza otwiera wykresy per wymiar.
Per wymiar — siatka 11 wykresów rozrzutu
Tysiąc słów tabel skraca się do tej siatki: 11 paneli, jeden na wymiar samoopisowy, każda kropka to jedna persona w jednym modelu. Im bliżej prostej rosnącej, tym lepiej model odzyskał zaprojektowany porządek person. Najechanie na model w legendzie wyróżnia jego kropki we wszystkich panelach.
DBZ-R · lęk
med r = +0.90DBZ-R · unikanie
med r = +0.86MentS · siebie
med r = +0.62MentS · innych
med r = +0.81MentS · motywacji
med r = +0.71KPP
med r = +0.72TIPI · E
med r = +0.83TIPI · A
med r = +0.76TIPI · C
med r = +0.79TIPI · ES
med r = +0.83TIPI · O
med r = +0.84Profile błędów TCTM-22 wg taksonomii MASC — trajektoria DOS / NAD / BK
Słupki skumulowane pokazują, jak rozkład trzech taksonomicznych typów błędu zmienia się dla każdego modelu między warunkami: persona (przebieg 1), baseline (model jako on sam) i zero-prompt (bez instrukcji systemowej). Kategorie dystraktorów przypisał autor według taksonomii MASC (Dziobek 2006); nie zostały niezależnie zaadjudykowane, więc to wielkości wierności bodźca, nie zwalidowane oszacowania trafności.
| grupa | persona | baseline | zero-prompt |
|---|---|---|---|
Human | — | — | |
Sonnet | |||
Opus | |||
GPT | |||
GPT54 | |||
GPT55 | — | ||
Grok | |||
Gemini |
Oś DOS × NAD — pozycje strategii błędu
Każdy model w każdym warunku to jedna kropka na płaszczyźnie (DOS%, NAD%). Przekątna oznacza profil symetryczny, lewy dolny róg bezbłędność, prawy górny chaos. Brzegi sygnalizują dominację jednego typu błędu.
Każda kropka to para (model × warunek). Kropka pełna to pierwszy przebieg persony, częściowa to baseline, najjaśniejsza to zero-prompt. Czerwona przekątna oznacza profil symetryczny (DOS = NAD).
Lewy dolny róg — oba wskaźniki niskie, czyli bezbłędność. Prawy górny — chaos. Brzegi sygnalizują dominację jednego typu błędu.
- HumanDOS 32 · NAD 36
- SonnetDOS 81 · NAD 19
- OpusDOS 84 · NAD 9
- GPTDOS 59 · NAD 13
- GPT54DOS 27 · NAD 12
- GPT55DOS 53 · NAD 44
- GrokDOS 36 · NAD 35
- GeminiDOS 18 · NAD 45
22 winiety × 7 modeli — taksonomia błędu na pozycję
Najgłębsza warstwa: każda komórka pokazuje rozkład correct / DOS / NAD / BK dla pary (winieta × model), zsumowany po 30 personach w pierwszym przebiegu warunku persona. Kliknięcie komórki otwiera szufladę z formułą i surowymi licznikami.
| item | Sonnet | Opus | GPT | GPT54 | GPT55 | Grok | Gemini | LLM Σ |
|---|---|---|---|---|---|---|---|---|
| w01 | ||||||||
| s07 | ||||||||
| s08 | ||||||||
| s10 | ||||||||
| w08 | ||||||||
| c07 | ||||||||
| c10 | ||||||||
| w11 | ||||||||
| w13 | ||||||||
| w14 | ||||||||
| e08 | ||||||||
| w15 | ||||||||
| w19 | ||||||||
| pw07 | ||||||||
| w22 | ||||||||
| pw09 | ||||||||
| pw11 | ||||||||
| w25 | ||||||||
| r08 | ||||||||
| w28 | ||||||||
| r09 | ||||||||
| r10 |
Krzywa trudności pozycji
22 winiety na osi X, sortowane od najtrudniejszej dla człowieka. Krzywa dla każdego modelu plus przerywana linia człowieka (n = 7). Modele utrzymujące wysoką trafność na lewym krańcu osi, tam gdzie człowiek wypada najsłabiej, to wzorzec „trudne dla człowieka, łatwe dla modelu” — sygnał, że klucz autorski mówi po modelowemu.
Najlepiej i najgorzej dopasowane persony w każdym modelu
Po trzy persony z góry i z dołu dla każdego modelu, według średniej |z obserwowane − ranga oczekiwana| z dziewięciu wymiarów wystandaryzowanych. Pokazuje, które biografie dany model rozumie wzorowo, a które mu uciekają.
Ranking trudności person
30 person od najtrudniejszej (najwyższa średnia |z − ranga| we wszystkich aktywnych modelach) do najłatwiejszej. Wysokie SD między modelami oznacza, że część modeli rozumie tę personę, a część ją mija.
| # | persona | styl | średni |Δz| | SD per model | obs. |
|---|---|---|---|---|---|
| 1 | marek | Zdez. | 1.63 | 0.23 | 63 |
| 2 | natalia | Lęk. | 1.15 | 0.19 | 63 |
| 3 | dominika | Unik. | 1.12 | 0.15 | 63 |
| 4 | michal-sim | Zdez. | 1.11 | 0.17 | 63 |
| 5 | piotr | Zdez. | 1.05 | 0.09 | 63 |
| 6 | radek | Zdez. | 1.05 | 0.15 | 63 |
| 7 | filip | Zdez. | 1.01 | 0.11 | 63 |
| 8 | klaudia | Lęk. | 0.98 | 0.13 | 63 |
| 9 | michal-k | Lęk. | 0.93 | 0.08 | 63 |
| 10 | hubert | Unik. | 0.90 | 0.13 | 63 |
| 11 | bartek | Lęk. | 0.88 | 0.08 | 63 |
| 12 | kamil | Zdez. | 0.86 | 0.12 | 63 |
| 13 | pawel | Lęk. | 0.85 | 0.16 | 63 |
| 14 | magda | Unik. | 0.83 | 0.16 | 63 |
| 15 | anna-sim | Bezp. | 0.80 | 0.11 | 63 |
| 16 | adrian | Unik. | 0.79 | 0.12 | 63 |
| 17 | jakub | Unik. | 0.78 | 0.26 | 63 |
| 18 | tomek | Unik. | 0.78 | 0.10 | 63 |
| 19 | agata | Unik. | 0.77 | 0.10 | 63 |
| 20 | zuzia | Zdez. | 0.77 | 0.17 | 63 |
| 21 | sara | Bezp. | 0.75 | 0.13 | 63 |
| 22 | gabriela | Lęk. | 0.73 | 0.07 | 63 |
| 23 | jola | Lęk. | 0.69 | 0.13 | 63 |
| 24 | kuba | Bezp. | 0.68 | 0.05 | 63 |
| 25 | weronika | Bezp. | 0.64 | 0.14 | 63 |
| 26 | ola | Bezp. | 0.64 | 0.18 | 63 |
| 27 | kasia | Bezp. | 0.57 | 0.09 | 63 |
| 28 | ewa | Zdez. | 0.57 | 0.08 | 63 |
| 29 | lukasz | Bezp. | 0.55 | 0.09 | 63 |
| 30 | ania | Lęk. | 0.50 | 0.11 | 63 |
Sekcja
Czy reakcja generalizuje się między producentami?
Na danych po korekcie siedem modeli tworzy jeden klaster: κ Fleissa = 0,853 (raportowana jako opisowa zgodność panelu — modele nie są niezależnymi sędziami), a wszystkie 21 par median korelacji profili person mieści się w przedziale [0,947; 0,989]. ICC i Q Cochrana poniżej liczą się na żywo dla aktywnego zestawu modeli; przełącz na zbiórkę wstępną, żeby zobaczyć, jak rozszczepiony wyglądał panel przed korektą bodźca.
Manuskrypt §3.2 · weryfikacja §6 · 4 sprawdzenia
7 modeli
wspólne n=30Spójność trafności TCTM-22 między modelami, liczona na przecięciu person, dla których wszystkie modele zwróciły kompletną odpowiedź.
6 modeli (bez GPT-5.4 full)
wspólne n=30Spójność trafności TCTM-22 między modelami, liczona na przecięciu person, dla których wszystkie modele zwróciły kompletną odpowiedź.
5 modeli (bez GPT-5.5 i GPT-5.4 full)
wspólne n=30Spójność trafności TCTM-22 między modelami, liczona na przecięciu person, dla których wszystkie modele zwróciły kompletną odpowiedź.
4 modele (bez żadnego GPT)
wspólne n=30Spójność trafności TCTM-22 między modelami, liczona na przecięciu person, dla których wszystkie modele zwróciły kompletną odpowiedź.
κ Fleissa — zgodność klasyfikacji stylu
κ Fleissa rozszerza κ Cohena na więcej niż dwóch sędziów. Mierzy zgodność aktywnych modeli w przypisywaniu personie etykiety stylu przywiązania, skorygowaną o zgodność, jakiej można oczekiwać samym przypadkiem: 0 to poziom losowy, 1 to pełna jednomyślność.
7 modeli
wspólne n=30Q Cochrana na pozycję (22 winiety TCTM)
Test Cochrana sprawdza, czy proporcje sukcesu różnią się istotnie między modelami na każdej z 22 pozycji TCTM-22. Zielone — istotne po korekcie Bonferroniego, żółte — po BH FDR. Kliknięcie kropki pokazuje rozbicie trafności modeli dla danej winiety. Wartości przeliczają się na żywo przy zmianie filtra.
Konwergencja TCTM × MentS-Total
Jeśli TCTM-22 i MentS-PL mierzą tę samą mentalizację, w obrębie modelu spodziewamy się korelacji dodatniej. Empirycznie wyniki są słabe i niespójne, co sugeruje różne konstrukty — albo że klucz autorski TCTM mierzy coś innego niż intuicja modelu.
Sonnet
Opus
GPT
GPT54
GPT55
Grok
Gemini
Per-item TCTM-22 — człowiek vs model
22 winiety osobno: trafność człowieka (n = 7) i każdego aktywnego modelu, domyślnie sortowane po Δ (średnia modeli − człowiek). Duże dodatnie Δ to pozycje, które modele rozwiązują znacznie lepiej niż ludzie.
| Sonnet | Opus | GPT | GPT54 | GPT55 | Grok | Gemini | ||||
|---|---|---|---|---|---|---|---|---|---|---|
| w28 | 14%(1/7) | 100 | 53 | 93 | 93 | 93 | 67 | 100 | 86 | +71 |
| w19 | 29%(2/7) | 100 | 77 | 93 | 83 | 53 | 97 | 43 | 78 | +50 |
| pw07 | 43%(3/7) | 100 | 100 | 43 | 97 | 100 | 97 | 97 | 90 | +48 |
| c10 | 57%(4/7) | 100 | 97 | 100 | 97 | 100 | 97 | 97 | 98 | +41 |
| w25 | 57%(4/7) | 97 | 97 | 100 | 100 | 100 | 97 | 97 | 98 | +41 |
| w08 | 57%(4/7) | 100 | 97 | 100 | 100 | 100 | 90 | 97 | 98 | +40 |
| w13 | 57%(4/7) | 100 | 90 | 93 | 100 | 100 | 97 | 97 | 97 | +40 |
| e08 | 57%(4/7) | 100 | 97 | 83 | 97 | 100 | 97 | 97 | 96 | +39 |
| r10 | 57%(4/7) | 97 | 97 | 63 | 93 | 93 | 97 | 97 | 91 | +34 |
| w15 | 57%(4/7) | 100 | 97 | 27 | 100 | 100 | 97 | 100 | 89 | +31 |
| pw09 | 71%(5/7) | 100 | 100 | 100 | 100 | 100 | 90 | 100 | 99 | +27 |
| r09 | 71%(5/7) | 100 | 100 | 93 | 100 | 100 | 97 | 100 | 99 | +27 |
| c07 | 71%(5/7) | 100 | 97 | 100 | 97 | 97 | 97 | 100 | 98 | +27 |
| pw11 | 86%(6/7) | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 | +14 |
| r08 | 86%(6/7) | 100 | 100 | 97 | 100 | 100 | 100 | 100 | 100 | +14 |
| s08 | 86%(6/7) | 100 | 100 | 100 | 100 | 100 | 97 | 100 | 100 | +14 |
| s10 | 86%(6/7) | 100 | 100 | 100 | 100 | 100 | 97 | 100 | 100 | +14 |
| w11 | 71%(5/7) | 100 | 100 | 77 | 100 | 100 | 83 | 33 | 85 | +13 |
| w14 | 86%(6/7) | 83 | 97 | 97 | 77 | 97 | 90 | 97 | 91 | +5 |
| s07 | 71%(5/7) | 100 | 27 | 7 | 97 | 97 | 87 | 90 | 72 | +0 |
| w01 | 100%(7/7) | 100 | 97 | 77 | 100 | 97 | 93 | 97 | 94 | -6 |
| w22 | 57%(4/7) | 17 | 0 | 83 | 0 | 53 | 57 | 7 | 31 | -26 |
Krzywa kumulacyjnej trafności
Pozycje sortowane rosnąco po trafności człowieka; oś Y to średnia krocząca trafności na pierwszych k pozycjach. Linie modeli rozjeżdżają się z linią człowieka tam, gdzie różnice są największe.
Korelacje między 22 pozycjami TCTM
Macierz 22 × 22 — współczynnik Pearsona między wynikami binarnymi (1 = trafienie, 0 = pudło) na pozycję. Bloki ciepłych pól sugerują grupy pozycji o wspólnej strukturze sukcesu i porażki, czyli przybliżenie struktury czynnikowej.
| w01 | s07 | s08 | s10 | w08 | c07 | c10 | w11 | w13 | w14 | e08 | w15 | w19 | pw07 | w22 | pw09 | pw11 | w25 | r08 | w28 | r09 | r10 | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| w01 | ||||||||||||||||||||||
| s07 | ||||||||||||||||||||||
| s08 | ||||||||||||||||||||||
| s10 | ||||||||||||||||||||||
| w08 | ||||||||||||||||||||||
| c07 | ||||||||||||||||||||||
| c10 | ||||||||||||||||||||||
| w11 | ||||||||||||||||||||||
| w13 | ||||||||||||||||||||||
| w14 | ||||||||||||||||||||||
| e08 | ||||||||||||||||||||||
| w15 | ||||||||||||||||||||||
| w19 | ||||||||||||||||||||||
| pw07 | ||||||||||||||||||||||
| w22 | ||||||||||||||||||||||
| pw09 | ||||||||||||||||||||||
| pw11 | ||||||||||||||||||||||
| w25 | ||||||||||||||||||||||
| r08 | ||||||||||||||||||||||
| w28 | ||||||||||||||||||||||
| r09 | ||||||||||||||||||||||
| r10 |
Dyspersja retestu |Δz| na skalę
Dla każdej z dziewięciu skal wystandaryzowanych: rozkład |z(przebieg 1) − z(przebieg 2)| w każdym modelu jako mini wykres pudełkowy. Mniejsza mediana oznacza bardziej deterministyczny retest. Czerwona linia przerywana odpowiada granicy 0,5 SD.
Sekcja
Skąd bierze się obserwowana wariancja odpowiedzi?
Profile bazowe „jako Ty — model” dzielą wspólną sygnaturę aprobaty społecznej (lęk głęboko poniżej polskiej normy, mentalizacja i potrzeba poznania wysoko powyżej), ale różnią się między modelami nawet o 1,7 SD na polskich normach — najszerzej na unikaniu, ekstrawersji i ugodowości. Wykresy poniżej liczą przesunięcia i wariancję na żywo dla aktywnego zestawu.
Manuskrypt §3.3, tabela 7 · weryfikacja §5 · 20 sprawdzeń
DBZ-R · lęk
Δ noprompt − baselineDBZ-R · unikanie
Δ noprompt − baselineMentS · suma
Δ noprompt − baselineTIPI · stab. emoc.
Δ noprompt − baselineWarunek bazowy — sygnatura modelu „jako siebie”
Co zwracają modele poproszone o wypełnienie baterii jako one same? Każdy ma stabilną sygnaturę odpowiedzi w nieobecności persony. Ostatnia kolumna to d Cohena dla MentS persona vs baseline (kliknięcie otwiera pełne rozbicie).
| model | n | styl dominujący | ANX | AVO | MentS | KPP | TCTM M ± SD | TIPI-ES | d / g MentS persona vs baseline |
|---|---|---|---|---|---|---|---|---|---|
Sonnet | 10 | Unik. | 2.11 | 4.10 | 122 | 4.74 | 21.0 ± 0.00 | 5.4 | |
Opus | 10 | Bezp. | 2.23 | 2.79 | 129 | 4.68 | 20.0 ± 0.00 | 5.3 | |
GPT | 10 | Bezp. | 1.69 | 3.02 | 131 | 4.96 | 19.1 ± 1.10 | 6.3 | |
GPT54 | 10 | Bezp. | 1.48 | 3.54 | 123 | 4.92 | 20.8 ± 0.42 | 7.0 | |
GPT55 | 10 | Bezp. | 1.26 | 3.42 | 128 | 4.89 | 21.8 ± 0.42 | 7.0 | |
Grok | 10 | Bezp. | 1.76 | 2.42 | 132 | 4.87 | 21.6 ± 0.70 | 6.5 | |
Gemini | 10 | Bezp. | 1.02 | 2.77 | 136 | 4.99 | 19.9 ± 0.32 | 7.0 |
Wariancja persona / baseline
O ile instrukcja persony rozszerza wariancję odpowiedzi względem warunku bazowego? Mediana 3,5×–8,9× przekonuje, że biografie faktycznie generują różne profile, a nie że model sprowadza je do jednej wartości domyślnej.
Kotwiczenie w normach — odległość od polskich norm populacyjnych
Dla każdej skali samoopisowej, każdego modelu i każdego z trzech warunków: odległość obserwowanej średniej od polskiej normy populacyjnej w jednostkach SD normy. Pas ±1 SD to przedział odpowiedzi typowej. Źródła norm: Lubiewska 2016 (DBZ-R), Jańczak 2021 (MentS-PL), Matusz 2011 (KPP), Sorokowska 2014 (TIPI-PL).
MentS — podskale Self / Other / Motivation na personę i model
Trzy paski w wierszu pokazują rozkład samoopisowej mentalizacji na podskale. Pionowa biała kreska na każdym pasku to mediana polskiej normy. Kliknięcie wiersza otwiera pełne rozbicie z sumą wystandaryzowaną.
| persona | model | self | other | motivation | Σ vs norma |
|---|---|---|---|---|---|
| adrian | Sonnet | 21 | 30 | 34 | 85 (-1.5 σ) |
| adrian | Opus | 24 | 28 | 29 | 81 (-1.8 σ) |
| adrian | GPT | 19 | 36 | 41 | 96 (-0.7 σ) |
| adrian | GPT54 | 17 | 27 | 33 | 77 (-2.0 σ) |
| adrian | GPT55 | 19 | 29 | 28 | 76 (-2.1 σ) |
| adrian | Grok | 22 | 35 | 38 | 95 (-0.7 σ) |
| adrian | Gemini | 19 | 28 | 35 | 82 (-1.7 σ) |
| agata | Sonnet | 32 | 40 | 42 | 114 (+0.7 σ) |
| agata | Opus | 38 | 40 | 43 | 121 (+1.2 σ) |
| agata | GPT | 34 | 42 | 45 | 121 (+1.2 σ) |
| agata | GPT54 | 34 | 39 | 41 | 114 (+0.7 σ) |
| agata | GPT55 | 34 | 41 | 40 | 115 (+0.7 σ) |
| agata | Grok | 31 | 42 | 46 | 119 (+1.0 σ) |
| agata | Gemini | 36 | 40 | 38 | 114 (+0.7 σ) |
| ania | Sonnet | 26 | 42 | 49 | 117 (+0.9 σ) |
| ania | Opus | 30 | 40 | 48 | 118 (+0.9 σ) |
| ania | GPT | 25 | 41 | 48 | 114 (+0.7 σ) |
| ania | GPT54 | 35 | 42 | 49 | 126 (+1.5 σ) |
| ania | GPT55 | 34 | 42 | 49 | 125 (+1.5 σ) |
| ania | Grok | 30 | 47 | 48 | 125 (+1.5 σ) |
| ania | Gemini | 27 | 41 | 49 | 117 (+0.9 σ) |
| anna-sim | Sonnet | 28 | 39 | 34 | 101 (-0.3 σ) |
| anna-sim | Opus | 32 | 41 | 32 | 105 (+0.0 σ) |
| anna-sim | GPT | 32 | 45 | 44 | 121 (+1.2 σ) |
| anna-sim | GPT54 | 26 | 42 | 26 | 94 (-0.8 σ) |
| anna-sim | GPT55 | 31 | 42 | 26 | 99 (-0.4 σ) |
| anna-sim | Grok | 28 | 44 | 40 | 112 (+0.5 σ) |
| anna-sim | Gemini | 31 | 45 | 38 | 114 (+0.7 σ) |
| bartek | Sonnet | 27 | 41 | 48 | 116 (+0.8 σ) |
| bartek | Opus | 31 | 40 | 47 | 118 (+0.9 σ) |
| bartek | GPT | 26 | 44 | 48 | 118 (+0.9 σ) |
| bartek | GPT54 | 35 | 42 | 48 | 125 (+1.5 σ) |
| bartek | GPT55 | 32 | 42 | 48 | 122 (+1.2 σ) |
| bartek | Grok | 32 | 45 | 49 | 126 (+1.5 σ) |
| bartek | Gemini | 22 | 41 | 48 | 111 (+0.4 σ) |
| dominika | Sonnet | 21 | 45 | 43 | 109 (+0.3 σ) |
| dominika | Opus | 30 | 47 | 43 | 120 (+1.1 σ) |
| dominika | GPT | 21 | 48 | 47 | 116 (+0.8 σ) |
| dominika | GPT54 | 18 | 44 | 44 | 106 (+0.1 σ) |
| dominika | GPT55 | 20 | 43 | 41 | 104 (-0.1 σ) |
| dominika | Grok | 29 | 46 | 48 | 123 (+1.3 σ) |
| dominika | Gemini | 25 | 47 | 45 | 117 (+0.9 σ) |
| ewa | Sonnet | 25 | 46 | 48 | 119 (+1.0 σ) |
| ewa | Opus | 32 | 44 | 49 | 125 (+1.5 σ) |
| ewa | GPT | 30 | 49 | 50 | 129 (+1.8 σ) |
| ewa | GPT54 | 28 | 43 | 48 | 119 (+1.0 σ) |
| ewa | GPT55 | 30 | 48 | 49 | 127 (+1.6 σ) |
| ewa | Grok | 33 | 49 | 48 | 130 (+1.8 σ) |
| ewa | Gemini | 29 | 47 | 48 | 124 (+1.4 σ) |
| filip | Sonnet | 24 | 40 | 46 | 110 (+0.4 σ) |
| filip | Opus | 28 | 44 | 48 | 120 (+1.1 σ) |
| filip | GPT | 21 | 46 | 49 | 116 (+0.8 σ) |
| filip | GPT54 | 26 | 41 | 47 | 114 (+0.7 σ) |
| filip | GPT55 | 25 | 43 | 48 | 116 (+0.8 σ) |
| filip | Grok | 20 | 44 | 47 | 111 (+0.4 σ) |
| filip | Gemini | 23 | 41 | 48 | 112 (+0.5 σ) |
| gabriela | Sonnet | 26 | 41 | 46 | 113 (+0.6 σ) |
| gabriela | Opus | 29 | 41 | 47 | 117 (+0.9 σ) |
| gabriela | GPT | 25 | 46 | 45 | 116 (+0.8 σ) |
| gabriela | GPT54 | 27 | 43 | 47 | 117 (+0.9 σ) |
| gabriela | GPT55 | 28 | 43 | 47 | 118 (+0.9 σ) |
| gabriela | Grok | 22 | 44 | 46 | 112 (+0.5 σ) |
| gabriela | Gemini | 33 | 45 | 47 | 125 (+1.5 σ) |
| hubert | Sonnet | 18 | 31 | 35 | 84 (-1.5 σ) |
| hubert | Opus | 18 | 26 | 31 | 75 (-2.2 σ) |
| hubert | GPT | 18 | 39 | 45 | 102 (-0.2 σ) |
| hubert | GPT54 | 16 | 26 | 34 | 76 (-2.1 σ) |
| hubert | GPT55 | 20 | 24 | 34 | 78 (-2.0 σ) |
| hubert | Grok | 12 | 33 | 41 | 86 (-1.4 σ) |
| hubert | Gemini | 14 | 26 | 34 | 74 (-2.3 σ) |
| jakub | Sonnet | 25 | 36 | 30 | 91 (-1.0 σ) |
| jakub | Opus | 31 | 36 | 29 | 96 (-0.7 σ) |
| jakub | GPT | 25 | 39 | 43 | 107 (+0.1 σ) |
| jakub | GPT54 | 26 | 37 | 25 | 88 (-1.2 σ) |
| jakub | GPT55 | 30 | 35 | 25 | 90 (-1.1 σ) |
| jakub | Grok | 15 | 32 | 31 | 78 (-2.0 σ) |
| jakub | Gemini | 34 | 39 | 31 | 104 (-0.1 σ) |
| jola | Sonnet | 26 | 49 | 48 | 123 (+1.3 σ) |
| jola | Opus | 32 | 47 | 50 | 129 (+1.8 σ) |
| jola | GPT | 28 | 49 | 50 | 127 (+1.6 σ) |
| jola | GPT54 | 32 | 47 | 49 | 128 (+1.7 σ) |
| jola | GPT55 | 30 | 47 | 50 | 127 (+1.6 σ) |
| jola | Grok | 24 | 46 | 48 | 118 (+0.9 σ) |
| jola | Gemini | 29 | 46 | 50 | 125 (+1.5 σ) |
| kamil | Sonnet | 25 | 37 | 38 | 100 (-0.4 σ) |
| kamil | Opus | 25 | 38 | 38 | 101 (-0.3 σ) |
| kamil | GPT | 21 | 41 | 44 | 106 (+0.1 σ) |
| kamil | GPT54 | 21 | 39 | 43 | 103 (-0.1 σ) |
| kamil | GPT55 | 26 | 39 | 42 | 107 (+0.1 σ) |
| kamil | Grok | 16 | 38 | 44 | 98 (-0.5 σ) |
| kamil | Gemini | 25 | 39 | 44 | 108 (+0.2 σ) |
| kasia | Sonnet | 38 | 48 | 50 | 136 (+2.3 σ) |
| kasia | Opus | 39 | 47 | 48 | 134 (+2.1 σ) |
| kasia | GPT | 37 | 49 | 49 | 135 (+2.2 σ) |
| kasia | GPT54 | 39 | 46 | 50 | 135 (+2.2 σ) |
| kasia | GPT55 | 40 | 47 | 50 | 137 (+2.3 σ) |
| kasia | Grok | 31 | 50 | 48 | 129 (+1.8 σ) |
| kasia | Gemini | 37 | 49 | 50 | 136 (+2.3 σ) |
| klaudia | Sonnet | 24 | 45 | 46 | 115 (+0.7 σ) |
| klaudia | Opus | 29 | 46 | 46 | 121 (+1.2 σ) |
| klaudia | GPT | 25 | 44 | 46 | 115 (+0.7 σ) |
| klaudia | GPT54 | 21 | 46 | 46 | 113 (+0.6 σ) |
| klaudia | GPT55 | 19 | 48 | 48 | 115 (+0.7 σ) |
| klaudia | Grok | 23 | 49 | 47 | 119 (+1.0 σ) |
| klaudia | Gemini | 24 | 46 | 45 | 115 (+0.7 σ) |
| kuba | Sonnet | 34 | 44 | 49 | 127 (+1.6 σ) |
| kuba | Opus | 34 | 43 | 50 | 127 (+1.6 σ) |
| kuba | GPT | 34 | 48 | 50 | 132 (+2.0 σ) |
| kuba | GPT54 | 34 | 44 | 49 | 127 (+1.6 σ) |
| kuba | GPT55 | 35 | 44 | 50 | 129 (+1.8 σ) |
| kuba | Grok | 31 | 45 | 49 | 125 (+1.5 σ) |
| kuba | Gemini | 33 | 46 | 49 | 128 (+1.7 σ) |
| lukasz | Sonnet | 24 | 39 | 43 | 106 (+0.1 σ) |
| lukasz | Opus | 26 | 40 | 42 | 108 (+0.2 σ) |
| lukasz | GPT | 27 | 44 | 47 | 118 (+0.9 σ) |
| lukasz | GPT54 | 28 | 42 | 47 | 117 (+0.9 σ) |
| lukasz | GPT55 | 30 | 43 | 47 | 120 (+1.1 σ) |
| lukasz | Grok | 30 | 43 | 46 | 119 (+1.0 σ) |
| lukasz | Gemini | 27 | 45 | 49 | 121 (+1.2 σ) |
| magda | Sonnet | 25 | 37 | 42 | 104 (-0.1 σ) |
| magda | Opus | 26 | 39 | 37 | 102 (-0.2 σ) |
| magda | GPT | 28 | 40 | 45 | 113 (+0.6 σ) |
| magda | GPT54 | 20 | 38 | 42 | 100 (-0.4 σ) |
| magda | GPT55 | 23 | 40 | 40 | 103 (-0.1 σ) |
| magda | Grok | 21 | 44 | 45 | 110 (+0.4 σ) |
| magda | Gemini | 31 | 42 | 45 | 118 (+0.9 σ) |
| marek | Sonnet | 17 | 21 | 22 | 60 (-3.3 σ) |
| marek | Opus | 18 | 24 | 27 | 69 (-2.6 σ) |
| marek | GPT | 12 | 22 | 22 | 56 (-3.6 σ) |
| marek | GPT54 | 11 | 23 | 21 | 55 (-3.6 σ) |
| marek | GPT55 | 11 | 23 | 21 | 55 (-3.6 σ) |
| marek | Grok | 11 | 23 | 24 | 58 (-3.4 σ) |
| marek | Gemini | 13 | 24 | 20 | 57 (-3.5 σ) |
| michal-k | Sonnet | 26 | 39 | 45 | 110 (+0.4 σ) |
| michal-k | Opus | 29 | 40 | 46 | 115 (+0.7 σ) |
| michal-k | GPT | 25 | 45 | 47 | 117 (+0.9 σ) |
| michal-k | GPT54 | 26 | 41 | 47 | 114 (+0.7 σ) |
| michal-k | GPT55 | 25 | 39 | 47 | 111 (+0.4 σ) |
| michal-k | Grok | 22 | 42 | 47 | 111 (+0.4 σ) |
| michal-k | Gemini | 23 | 41 | 47 | 111 (+0.4 σ) |
| michal-sim | Sonnet | 17 | 35 | 38 | 90 (-1.1 σ) |
| michal-sim | Opus | 23 | 31 | 36 | 90 (-1.1 σ) |
| michal-sim | GPT | 15 | 40 | 43 | 98 (-0.5 σ) |
| michal-sim | GPT54 | 16 | 35 | 37 | 88 (-1.2 σ) |
| michal-sim | GPT55 | 16 | 38 | 37 | 91 (-1.0 σ) |
| michal-sim | Grok | 15 | 35 | 36 | 86 (-1.4 σ) |
| michal-sim | Gemini | 16 | 31 | 38 | 85 (-1.5 σ) |
| natalia | Sonnet | 14 | 29 | 27 | 70 (-2.6 σ) |
| natalia | Opus | 17 | 27 | 32 | 76 (-2.1 σ) |
| natalia | GPT | 17 | 29 | 27 | 73 (-2.3 σ) |
| natalia | GPT54 | 14 | 28 | 27 | 69 (-2.6 σ) |
| natalia | GPT55 | 13 | 30 | 30 | 73 (-2.3 σ) |
| natalia | Grok | 11 | 25 | 26 | 62 (-3.1 σ) |
| natalia | Gemini | 14 | 25 | 29 | 68 (-2.7 σ) |
| ola | Sonnet | 29 | 36 | 27 | 92 (-0.9 σ) |
| ola | Opus | 30 | 35 | 27 | 92 (-0.9 σ) |
| ola | GPT | 34 | 36 | 31 | 101 (-0.3 σ) |
| ola | GPT54 | 27 | 35 | 24 | 86 (-1.4 σ) |
| ola | GPT55 | 30 | 34 | 24 | 88 (-1.2 σ) |
| ola | Grok | 16 | 37 | 28 | 81 (-1.8 σ) |
| ola | Gemini | 30 | 46 | 37 | 113 (+0.6 σ) |
| pawel | Sonnet | 17 | 32 | 29 | 78 (-2.0 σ) |
| pawel | Opus | 18 | 28 | 28 | 74 (-2.3 σ) |
| pawel | GPT | 19 | 39 | 41 | 99 (-0.4 σ) |
| pawel | GPT54 | 16 | 35 | 33 | 84 (-1.5 σ) |
| pawel | GPT55 | 16 | 38 | 33 | 87 (-1.3 σ) |
| pawel | Grok | 0 | 38 | 30 | 68 (-2.7 σ) |
| pawel | Gemini | 27 | 40 | 37 | 104 (-0.1 σ) |
| piotr | Sonnet | 16 | 30 | 35 | 81 (-1.8 σ) |
| piotr | Opus | 18 | 30 | 34 | 82 (-1.7 σ) |
| piotr | GPT | 16 | 37 | 39 | 92 (-0.9 σ) |
| piotr | GPT54 | 14 | 38 | 39 | 91 (-1.0 σ) |
| piotr | GPT55 | 14 | 36 | 41 | 91 (-1.0 σ) |
| piotr | Grok | 11 | 31 | 36 | 78 (-2.0 σ) |
| piotr | Gemini | 12 | 27 | 38 | 77 (-2.0 σ) |
| radek | Sonnet | 17 | 41 | 34 | 92 (-0.9 σ) |
| radek | Opus | 19 | 41 | 37 | 97 (-0.6 σ) |
| radek | GPT | 21 | 44 | 44 | 109 (+0.3 σ) |
| radek | GPT54 | 14 | 43 | 40 | 97 (-0.6 σ) |
| radek | GPT55 | 13 | 44 | 42 | 99 (-0.4 σ) |
| radek | Grok | 11 | 42 | 37 | 90 (-1.1 σ) |
| radek | Gemini | 13 | 42 | 34 | 89 (-1.2 σ) |
| sara | Sonnet | 32 | 47 | 47 | 126 (+1.5 σ) |
| sara | Opus | 32 | 46 | 44 | 122 (+1.2 σ) |
| sara | GPT | 37 | 49 | 47 | 133 (+2.0 σ) |
| sara | GPT54 | 32 | 47 | 46 | 125 (+1.5 σ) |
| sara | GPT55 | 34 | 48 | 47 | 129 (+1.8 σ) |
| sara | Grok | 33 | 50 | 47 | 130 (+1.8 σ) |
| sara | Gemini | 30 | 48 | 48 | 126 (+1.5 σ) |
| tomek | Sonnet | 18 | 44 | 41 | 103 (-0.1 σ) |
| tomek | Opus | 22 | 44 | 42 | 108 (+0.2 σ) |
| tomek | GPT | 13 | 45 | 45 | 103 (-0.1 σ) |
| tomek | GPT54 | 15 | 43 | 42 | 100 (-0.4 σ) |
| tomek | GPT55 | 16 | 42 | 41 | 99 (-0.4 σ) |
| tomek | Grok | 16 | 41 | 45 | 102 (-0.2 σ) |
| tomek | Gemini | 20 | 41 | 43 | 104 (-0.1 σ) |
| weronika | Sonnet | 33 | 45 | 48 | 126 (+1.5 σ) |
| weronika | Opus | 33 | 43 | 46 | 122 (+1.2 σ) |
| weronika | GPT | 34 | 49 | 48 | 131 (+1.9 σ) |
| weronika | GPT54 | 33 | 47 | 48 | 128 (+1.7 σ) |
| weronika | GPT55 | 33 | 47 | 47 | 127 (+1.6 σ) |
| weronika | Grok | 33 | 49 | 48 | 130 (+1.8 σ) |
| weronika | Gemini | 33 | 47 | 48 | 128 (+1.7 σ) |
| zuzia | Sonnet | 25 | 45 | 46 | 116 (+0.8 σ) |
| zuzia | Opus | 32 | 47 | 49 | 128 (+1.7 σ) |
| zuzia | GPT | 29 | 47 | 50 | 126 (+1.5 σ) |
| zuzia | GPT54 | 29 | 47 | 47 | 123 (+1.3 σ) |
| zuzia | GPT55 | 29 | 47 | 47 | 123 (+1.3 σ) |
| zuzia | Grok | 31 | 49 | 46 | 126 (+1.5 σ) |
| zuzia | Gemini | 19 | 45 | 46 | 110 (+0.4 σ) |
ANOVA jednoczynnikowa — czy warunki różnią się istotnie?
Dla każdej pary (model × skala) statystyka F porównuje średnie persona / baseline / zero-prompt. Kropka kolorowana według pasa istotności (p < 0,001 / 0,01 / 0,05). Wartość p liczona z transformacji Wilsona-Hilferty’ego.
| model skala | DBZ-R lęk | DBZ-R unikanie | MentS Σ | KPP | TIPI E | TIPI A | TIPI C | TIPI ES | TIPI O |
|---|---|---|---|---|---|---|---|---|---|
| Sonnet | |||||||||
| Opus | |||||||||
| GPT | |||||||||
| GPT54 | |||||||||
| GPT55 | |||||||||
| Grok | |||||||||
| Gemini |
Macierz d Cohena dla par modeli na skalę
Siatka wszystkich aktywnych modeli — wielkość efektu między każdą parą na danej skali samoopisowej w pierwszym przebiegu warunku persona. Kliknięcie komórki pokazuje g Hedgesa (z korektą obciążenia) oraz N obu grup.
| Sonnet | Opus | GPT | GPT54 | GPT55 | Grok | Gemini | |
|---|---|---|---|---|---|---|---|
| Sonnet | — | ||||||
| Opus | — | ||||||
| GPT | — | ||||||
| GPT54 | — | ||||||
| GPT55 | — | ||||||
| Grok | — | ||||||
| Gemini | — |
Sekcja
Meta — moc próby i pewność klasyfikacji
Czy obserwowane efekty mają wystarczające N? Czy klasyfikacje stylu przywiązania są pewne, czy graniczne? Trzy wykresy meta-poziomu zamykają argument o jakości badania.
Manuskrypt §3.4 · dyskusja §A.2
Macierz analizy mocy
Dla każdej pary (model × skala): obserwowane d Cohena oraz minimalne N na grupę potrzebne do wykrycia d ∈ {0,5; 0,8; 1,0} przy α = 0,05 i mocy 80%. Czerwone — niewykrywalne przy obecnym N, zielone — wykrywalne i duże.
| model skala | DBZ-R lęk | DBZ-R unikanie | MentS Σ | KPP | TIPI E | TIPI A | TIPI C | TIPI ES | TIPI O |
|---|---|---|---|---|---|---|---|---|---|
| Sonnet | |||||||||
| Opus | |||||||||
| GPT | |||||||||
| GPT54 | |||||||||
| GPT55 | |||||||||
| Grok | |||||||||
| Gemini |
Rzetelność wewnętrzna — α Cronbacha na skalę i model
Czy model odpowiada na 36 pozycji DBZ-R spójnie, czy chaotycznie? α Cronbacha liczona na poziomie POZYCJI, z odwróceniem punktacji zgodnym z procedurą przygotowania danych. Niska α nie oznacza, że odpowiedzi są błędne — oznacza, że bateria nie tworzy u tego modelu spójnej skali. Klucz: ≥ 0,90 doskonała · ≥ 0,70 akceptowalna · < 0,50 niedostateczna · < 0 odwrócona.
| skala model | Sonnet | Opus | GPT | GPT54 | GPT55 | Grok | Gemini |
|---|---|---|---|---|---|---|---|
| DBZ-R · lęk | |||||||
| DBZ-R · unikanie | |||||||
| MentS · suma | |||||||
| KPP |
Pewność klasyfikacji stylu
Dla każdej pary persona × model: margines = min(|średnia lęku − 4|, |średnia unikania − 4|), czyli odległość od progu decyzyjnego. Wysokie mediany to pewni klasyfikatorzy; liczba przypadków granicznych (margines < 0,5) to miara wahania modelu.
Status danych
skorygowana (fale 3–4, poprawione renderowanie bodźca — podstawa manuskryptu). Wszystkie wykresy używają aktywnego zestawu modeli z paska na górze. Wykresy per model filtrują render, wartości międzyproducenckie (ICC, Q Cochrana, κ Fleissa) przeliczają się z surowych danych. Filtr zapisuje się w adresie URL, więc widok da się udostępnić linkiem.