Metodologia · Paper §2 · UKEN Kraków
Jak powstał ten zbiór?
Pełny opis projektu badawczego — od pisania biografii, przez prompty systemowe i schematy JSON, po normy psychometryczne i etykę. Każde twierdzenie liczbowe linkuje do żywego wykresu na dashboardzie, gdzie można je sprawdzić ręcznie.
§2.1
Persony — 30 fikcyjnych biografii
Trzydzieści biografii w języku polskim (1 554 – 2 914 słów łącznie z metadanymi YAML; 1 489 – 2 861 słów narracyjnych po usunięciu YAML), napisanych w drugiej osobie, kodujących ustalone profile w 12 wymiarach (11 ciągłych + 1 kategoryczny):
- lęk i unikanie przywiązaniowe (DBZ-R)
- mentalizacja siebie / innych / motywacji (MentS-PL)
- potrzeba poznania (KPP)
- Wielka Piątka E/A/C/ES/O (TIPI-PL)
- czterokategoryjny styl przywiązania (kategoryczny)
Biografie zostały napisane przez pierwszego autora przy pomocy Claude Opus 4.6 jako asystenta pisarskiego; autor specyfikował profile, ograniczenia narracyjne i wymagania stylistyczne, a także recenzował i edytował każdą wersję roboczą. Sześć biografii (adrian, ewa, kuba, magda, pawel, weronika) zostało zrewidowanych po wstępnej recenzji i jest oznaczonych persona_version: v2; pozostałe są w wersji v1.
§2.2
Narzędzia — 4 polskie + 1 oryginalne
- DBZ-R (polska adaptacja ECR-R; 36 pozycji, Likert 1–7; Lubiewska 2016).
- MentS-PL (28 pozycji; Jańczak 2021) — mentalizacja siebie/innych/motywacji.
- KPP (36 pozycji; Matusz 2011) — potrzeba poznania.
- TIPI-PL (10 pozycji; Sorokowska 2014) — Wielka Piątka.
- TCTM-22 — autorski test winietowy mentalizacji. 22 winiety oceniane względem klucza autorskiego, z każdą opcją oznaczoną według taksonomii błędów MASC (Dziobek 2006): DOS (niedostateczna mentalizacja), NAD (nadmierna mentalizacja), BK (brak mentalizacji).
Cztery polskie narzędzia korzystają z opublikowanych norm — z-score'y na dashboardzie używają tych samych wartości referencyjnych, co recenzowane publikacje. TCTM-22 jest narzędziem oryginalnym, a niezgodność między modelami co do tego, które pozycje są trudne, jest sama w sobie dowodem, że klucz odpowiedzi może nie odzwierciedlać pojedynczego wspólnego konstruktu — patrz forest plot Cochran Q.
§2.3
Modele — 7 LLM-ów od 4 producentów
Siedem modeli, każdy dostępny przez oficjalne API producenta między 12 kwietnia a 28 maja 2026, z domyślnymi parametrami próbkowania:
| model | producent | platforma | run-1 + run-2 |
|---|---|---|---|
| Claude Sonnet 4.6 | Anthropic | AWS Bedrock | 30 + 30 |
| Claude Opus 4.6 | Anthropic | AWS Bedrock | 30 + 25 |
| GPT-5.4-mini | OpenAI | Azure OpenAI | 27 + 21 |
| GPT-5.4 (full) | OpenAI | Azure AI Foundry | 30 + 30 |
| GPT-5.5 | OpenAI | Azure AI Foundry | 30 + 30 |
| Grok-4-20-reasoning | xAI | Azure AI Foundry | 30 + 29 |
| Gemini 3 Flash | Gemini API | 30 + 28 | |
| Respondenci ludzcy | — | — | 7 |
Łącznie 460 ważnych przebiegów persona, 217 baseline, 77 zero-prompt; brakujące retesty wynikały z filtrów moderacji treści API, częściowych generacji lub niekompletnych odpowiedzi TCTM. GPT-5.4 (full) dodany 28 maja 2026 via Azure AI Foundry Responses API (deployment gpt-5.4, max_output_tokens = 16000). Dla runnerów Azure/OpenAI-compatible, które eksponowały kontrolki rozumowania w skryptach kolekcji v18 (run_gpt54.py, run_gpt55.py, run_grok.py,run_azure.py), kod żądania ustawiał temperature = 1.0,top_p = 1.0, seed = 20260528 orazreasoning_effort = „medium”. Przebiegi Claude Bedrock i Gemini nie używały parametru reasoning_effort; starsze skrypty baseline/noprompt nie przechowywały metadanych parametrów, więc nie obowiązywała jedna wspólna wartośćreasoning_effort dla wszystkich siedmiu modeli.
§2.4
3 warunki obserwacji
Warunek z personą (run-1 + run-2): model otrzymuje biografię w prompcie użytkownika oraz instrukcję systemową „Odpowiadasz jako osoba opisana poniżej. Przeczytaj uważnie biografię i odpowiadaj tak, jak ta osoba by odpowiedziała." 285 ważnych przebiegów.
Warunek bazowy: każdy model wypełnia baterię 7–10 razy jako on sam, z instrukcją systemową „Jesteś modelem językowym AI. Odpowiadaj na pytania szczerze, jak Ty — AI — byś odpowiedział, gdybyś musiał wybrać. Nie odgrywaj żadnej postaci. Odpowiadaj jako sam siebie." 46 ważnych przebiegów.
Warunek bez instrukcji: model otrzymuje tylko treść testu jako wiadomość użytkownika, bez prompta systemowego. 31 ważnych ładunków TCTM-22 (Sonnet 6, Opus 5, GPT 6, Grok 6, Gemini 8).
Razem porównanie persona / bazowy / bez instrukcji pozwala oddzielić trzy źródła wariancji odpowiedzi: nieodłączną stochastyczność wewnątrz warunku, wkład sformułowania instrukcyjnego oraz wkład promptu biograficznego — patrz wykres wariancji persona/baseline oraz framing shifts noprompt vs baseline.
§2.5
Pilotaż na ludziach (n=7)
Siedmiu respondentów (wiek 22–60, 4 mężczyzn, 3 kobiety; 2 studentów psychologii, 5 bez wykształcenia psychologicznego) wypełniło tę samą baterię online. Docelowa populacja dla ewentualnej walidacji to młodzi dorośli (18–35) w romantycznych lub bliskich związkach; jeden respondent (R07, 60 lat, kobieta) był poza tym zakresem i jest zachowany wyłącznie dla celów eksploracyjnych. W całej pracy pilotaż ludzki jest traktowany jako informacja opisowa, nie inferencyjna.
§2.6
Etyka
Pilotaż ludzki wykorzystał świadomą zgodę, ujawniającą cel badania, dobrowolność (prawo do wycofania w dowolnym momencie bez konsekwencji), zgodne z RODO przetwarzanie danych (szyfrowane przechowywanie, pięcioletni okres retencji, brak łączenia z osobistymi identyfikatorami) oraz linki do zasobów wsparcia zdrowia psychicznego (numery polskich krajowych telefonów kryzysowych). Wszystkich siedmiu respondentów wyraziło zgodę przed wypełnieniem baterii. Pilotaż jest nieinterwencyjny i nie używa populacji klinicznej.
Autor nie konsultował formalnie z instytucjonalną komisją bioetyczną statusu zwolnienia dla tego pilotu; czytelnicy powinni traktować część pilotażu na ludziach jako pre-pilotowe dane eksploracyjne w oczekiwaniu na taką konsultację (planowaną przed ewentualną przyszłą publikacją).
§2.7
Mierniki (8 grup)
- Dopasowanie stylu przywiązania (κ Cohena, V Cramera) — macierze konfuzji
- Korelacje rangowo-wynikowe (Pearson, Spearman) — rank-score + siatka 11 paneli
- Spójność z literaturą (10 znaków korelacji między skalami pochodzących z opublikowanych norm polskich)
- Stabilność test-retest (r Pearsona, ICC) — test-retest scatter
- Spójność między modelami (ICC, κ Fleissa) — ICC + Fleiss κ
- Profile błędów TCTM-22 (DOS / NAD / BK) — strip plot + bars
- Zgodność na poziomie pozycji między producentami (Q Cochrana z korekcjami Bonferroniego i BH-FDR) — forest plot
- Wielkość efektu dla przesunięć sformułowania (d Cohena pooled i Δ Glassa) — framing shifts
§2.8
Powtarzalność
Wszystkie siedem modeli było odpytywanych przez oficjalne API producentów między 12 kwietnia a 28 maja 2026, z domyślnymi parametrami próbkowania (temperature, top-p, max-output-tokens przy wartościach domyślnych dostawców). Prompty systemowe i schematy JSON wyjścia są reprodukowane verbatim w otwartym repozytorium.
Każde liczbowe twierdzenie w pracy jest reprodukowalne z opublikowanego all_data.csv (369 obserwacji × 53 kolumny) używając wyłącznie standardowej biblioteki; skrypty pomocnicze są na licencji CC BY 4.0.