κ Cohena Cohen's kappa Mierzy zgodność dwóch klasyfikatorów ponad zgodność losową. Wartość 0 = zgodność losowa; 1 = idealna; ujemna = gorsza niż losowa.
κ = (P_o − P_e) / (1 − P_e), gdzie P_o to obserwowana zgodność, a P_e — zgodność oczekiwana z brzegowych częstości przy losowym przyporządkowaniu.
Wikipedia
κ Fleissa Fleiss' kappa Wersja κ Cohena dla więcej niż dwóch klasyfikatorów. Mierzy spójność wielu sędziów ponad zgodność losową.
κ_Fleiss = (P̄ − P_e) / (1 − P_e); P̄ — średnia zgodność par sędziów na podmiotach, P_e — suma kwadratów udziałów kategorii.
Wikipedia
ICC(2,1) Intraclass correlation, two-way random, single rater Spójność pomiarów między sędziami (modelami) traktowanymi jako próbka losowa. Wartość ~1 = każdy sędzia daje podobną liczbę; ~0 = brak zgodności.
Shrout & Fleiss (1979): ICC(2,1) = (MS_R − MS_E) / (MS_R + (k−1)·MS_E + k·(MS_C − MS_E)/n).
Wikipedia
V Cramera Cramér's V Miara siły związku w tablicy kontyngencji. Skala 0–1; nie zależy od kierunku.
V = √(χ²/(n·(min(rzędów, kolumn)−1))).
Wikipedia
Q Cochrana Cochran's Q Test wewnątrzpodmiotowy dla k powtarzanych dychotomicznych pomiarów. Sprawdza, czy proporcje sukcesu różnią się między pomiarami.
Q = (k−1)(k·Σc² − G²) / (k·G − Σr²); rozkładem zerowym jest χ² z k−1 stopniami swobody.
Wikipedia
Korekcja Bonferroniego Bonferroni correction Najprostsza ochrona przed inflacją błędu I rodzaju przy wielu testach: dziel α przez liczbę testów.
Significant if p ≤ α/m. Konserwatywna; nie wymaga niezależności.
Wikipedia
BH FDR Benjamini-Hochberg false discovery rate Mniej konserwatywna procedura kontroli odsetka fałszywych odkryć. Zachowuje moc statystyczną przy wielu testach.
Posortuj p_(1) ≤ … ≤ p_(m); znajdź największe i takie że p_(i) ≤ (i/m)·q; wszystkie do tej rangi włącznie są istotne.
Wikipedia
d Cohena Cohen's d (pooled SD) Wielkość efektu — różnica średnich w jednostkach łącznego odchylenia standardowego. |d| < 0.2 — mały; ~0.5 — średni; > 0.8 — duży.
d = (M₁ − M₂) / s_pool; s_pool = √(((n₁−1)·s₁² + (n₂−1)·s₂²)/(n₁+n₂−2)).
Wikipedia
Δ Glassa Glass's delta Wielkość efektu liczona na SD grupy kontrolnej (a nie pooled). Preferowana, gdy SD grupy eksperymentalnej jest wyraźnie inna.
Δ = (M_exp − M_ctrl) / SD_ctrl.
Wikipedia
z-score standardised score Standaryzowana odległość od średniej populacji w jednostkach odchylenia standardowego. z = 0 — średnia; z = ±1 — typowa; |z| > 2 — rzadkie.
z = (x − μ) / σ. Tu μ i σ pochodzą z polskich norm psychometrycznych.
DBZ-R ECR-R polska adaptacja Kwestionariusz Doświadczeń w Bliskich Związkach — polska adaptacja ECR-R (Lubiewska 2016). Mierzy lęk i unikanie przywiązaniowe.
36 pozycji, Likert 1–7, dwie skale: Lęk (poz. 1–18) i Unikanie (19–36) z 14 pozycjami zwrotnie kodowanymi.
MentS-PL Mentalisation Scale, Polish Polskie narzędzie samoopisowe mierzące mentalizację — siebie, innych, motywacji (Jańczak 2021).
28 pozycji, Likert 1–5, trzy podskale; 10 pozycji zwrotnie kodowanych.
KPP Need for Cognition (Polish) Kwestionariusz Potrzeby Poznania (Matusz 2011). Mierzy skłonność do podejmowania wymagającej intelektualnie aktywności i czerpania z niej satysfakcji.
36 pozycji, Likert 1–5, 14 pozycji zwrotnie kodowanych.
TIPI-PL Ten-Item Personality Inventory, Polish Bardzo krótka miara Wielkiej Piątki — Sorokowska 2014 (N=1056). E, A, C, ES, O.
10 pozycji, Likert 1–7, każda cecha mierzona dwiema pozycjami (jedna zwrotna).
TCTM-22 Polish vignette mentalisation test (author original) Oryginalny autorski test winietowy mentalizacji — 22 winiety oceniane względem klucza autorskiego z taksonomią błędów MASC.
22 winiety × 4 odpowiedzi (A/B/C/D); jedna poprawna, pozostałe oznaczone jako DOS/NAD/BK.
MASC error taxonomy Movie for the Assessment of Social Cognition Trójpodział błędów teorii umysłu (Dziobek 2006): DOS — niedoceniający; NAD — nadinterpretujący; BK — nieczyniący wnioskowań.
Każda nieprawidłowa odpowiedź TCTM-22 jest oznaczona jako DOS (under-mentalisation), NAD (over-mentalisation) lub BK (no-mentalisation).
Style przywiązania Bartholomew four-category taxonomy Cztery klasy stylu przywiązania: bezpieczny, lękowo-ambiwalentny, unikający, zdezorganizowany (bojaźliwo-unikowy).
W tej pracy klasyfikacja oparta na progu DBZ-R: lęk ≥ 4 i/lub unikanie ≥ 4 → odpowiednie kombinacje stylu.
r Pearsona Pearson's r Współczynnik korelacji liniowej między dwiema zmiennymi ciągłymi. Wartość od −1 do +1; 0 = brak związku liniowego.
r = Σ (x − M_x)(y − M_y) / sqrt(Σ (x − M_x)² · Σ (y − M_y)²). Wrażliwy na outliery; wymaga homoskedastyczności i przybliżonej liniowości.
Wikipedia
ρ Spearmana Spearman's rho Korelacja monotoniczna — Pearson liczony na rangach. Mniej wrażliwy na outliery; mierzy zgodność porządku, nie liniowości.
ρ = Pearson(rank(x), rank(y)) z mean-rank ties. W tej pracy używany side-by-side z Pearsonem dla rank-score correlations.
Wikipedia
g Hedgesa Hedges' g Bias-corrected Cohen d. Mnoży d przez współczynnik Hedgesa J(N) który koryguje przeszacowanie efektu w małych próbach.
g = d · J(N), J(N) = 1 − 3 / (4·df − 1), df = n₁ + n₂ − 2. Dla dużych N g → d. Hedges & Olkin (1985).
Wikipedia
α Cronbacha Cronbach's alpha Współczynnik wewnętrznej spójności skali. Mierzy w jakim stopniu pozycje (itemy) skali mierzą tę samą cechę. Klucz: ≥ .9 doskonała, ≥ .7 akceptowalna, < .5 niedostateczna.
α = (k / (k−1)) · (1 − Σ Var(item_j) / Var(total)). Cronbach (1951). Niska α nie znaczy że odpowiedzi są błędne — znaczy że itemy nie tworzą spójnej skali u tego respondenta.
Wikipedia
ANOVA jednoczynnikowa One-way ANOVA Test sprawdzający czy średnie ≥3 grup różnią się istotnie. F-statystyka rośnie gdy MS_between (zmienność między grupami) >> MS_within (zmienność wewnątrzgrupowa).
F(df_num, df_den) = MS_B / MS_W. p obliczone z transformacji Wilsona-Hilferty'ego dla pielęgnowanej dokładności w małych próbach.
Wikipedia
Analiza mocy Power analysis Obliczenie minimalnej liczebności próby N potrzebnej do wykrycia danego efektu (np. d = 0.5) z założoną mocą (np. 80%) przy α = .05.
Dla testu t niezależnego: N_per_group ≈ 2 · ((z_{α/2} + z_β) / d)². Dla d = 0.5, 80% mocy: 64 na grupę. d = 0.8: 26 na grupę.
Wikipedia
Stabilność test-retest Test-retest reliability Korelacja między dwukrotnym pomiarem tej samej skali u tych samych respondentów. r > .9 = pomiar bardzo stabilny; r < .5 = sygnał stochastyczności.
W tej pracy: pearson(score_run1, score_run2) per persona pair, polityka complete-pair (tylko persony z ważnymi odpowiedziami w obu przebiegach).
Wikipedia
Trafność konstruktu Construct validity Zakres, w jakim narzędzie psychometryczne mierzy zamierzony konstrukt teoretyczny. Wymaga konwergencji z innymi miarami konstruktu i dywergencji z miarami innych konstruktów.
Cronbach & Meehl (1955). Sensitivity study (jak ta praca) jest warunkiem KONIECZNYM ale nie wystarczającym do walidacji konstruktu.
Wikipedia
Warunki obserwacji Persona / baseline / noprompt conditions Trzy projekty w tej pracy: persona (model otrzymuje biografię i odpowiada „jako ona"); baseline (model jako „on sam, AI"); noprompt (bateria bez instrukcji systemowej).
Razem rozdzielają trzy źródła wariancji odpowiedzi: stochastyczność wewnątrzwarunkową, wkład sformułowania instrukcyjnego i wkład prompta biograficznego.