Przejdź do treści

Metodologia · Paper §2 · UKEN Kraków

Jak powstał ten zbiór?

Pełny opis projektu badawczego — od pisania biografii, przez prompty systemowe i schematy JSON, po normy psychometryczne i etykę. Każde twierdzenie liczbowe linkuje do żywego wykresu na dashboardzie, gdzie można je sprawdzić ręcznie.

§2.1

Persony — 30 fikcyjnych biografii

Trzydzieści biografii w języku polskim (1 554 – 2 914 słów łącznie z metadanymi YAML; 1 489 – 2 861 słów narracyjnych po usunięciu YAML), napisanych w drugiej osobie, kodujących ustalone profile w 12 wymiarach (11 ciągłych + 1 kategoryczny):

  • lęk i unikanie przywiązaniowe (DBZ-R)
  • mentalizacja siebie / innych / motywacji (MentS-PL)
  • potrzeba poznania (KPP)
  • Wielka Piątka E/A/C/ES/O (TIPI-PL)
  • czterokategoryjny styl przywiązania (kategoryczny)

Biografie zostały napisane przez pierwszego autora przy pomocy Claude Opus 4.6 jako asystenta pisarskiego; autor specyfikował profile, ograniczenia narracyjne i wymagania stylistyczne, a także recenzował i edytował każdą wersję roboczą. Sześć biografii (adrian, ewa, kuba, magda, pawel, weronika) zostało zrewidowanych po wstępnej recenzji i jest oznaczonych persona_version: v2; pozostałe są w wersji v1.

Wszystkie 30 person z linkiem do biografii i wyników

§2.2

Narzędzia — 4 polskie + 1 oryginalne

  • DBZ-R (polska adaptacja ECR-R; 36 pozycji, Likert 1–7; Lubiewska 2016).
  • MentS-PL (28 pozycji; Jańczak 2021) — mentalizacja siebie/innych/motywacji.
  • KPP (36 pozycji; Matusz 2011) — potrzeba poznania.
  • TIPI-PL (10 pozycji; Sorokowska 2014) — Wielka Piątka.
  • TCTM-22 — autorski test winietowy mentalizacji. 22 winiety oceniane względem klucza autorskiego, z każdą opcją oznaczoną według taksonomii błędów MASC (Dziobek 2006): DOS (niedostateczna mentalizacja), NAD (nadmierna mentalizacja), BK (brak mentalizacji).

Cztery polskie narzędzia korzystają z opublikowanych norm — z-score'y na dashboardzie używają tych samych wartości referencyjnych, co recenzowane publikacje. TCTM-22 jest narzędziem oryginalnym, a niezgodność między modelami co do tego, które pozycje są trudne, jest sama w sobie dowodem, że klucz odpowiedzi może nie odzwierciedlać pojedynczego wspólnego konstruktu — patrz forest plot Cochran Q.

§2.3

Modele — 7 LLM-ów od 4 producentów

Siedem modeli, każdy dostępny przez oficjalne API producenta między 12 kwietnia a 28 maja 2026, z domyślnymi parametrami próbkowania:

modelproducentplatformarun-1 + run-2
Claude Sonnet 4.6AnthropicAWS Bedrock30 + 30
Claude Opus 4.6AnthropicAWS Bedrock30 + 25
GPT-5.4-miniOpenAIAzure OpenAI27 + 21
GPT-5.4 (full)OpenAIAzure AI Foundry30 + 30
GPT-5.5OpenAIAzure AI Foundry30 + 30
Grok-4-20-reasoningxAIAzure AI Foundry30 + 29
Gemini 3 FlashGoogleGemini API30 + 28
Respondenci ludzcy7

Łącznie 460 ważnych przebiegów persona, 217 baseline, 77 zero-prompt; brakujące retesty wynikały z filtrów moderacji treści API, częściowych generacji lub niekompletnych odpowiedzi TCTM. GPT-5.4 (full) dodany 28 maja 2026 via Azure AI Foundry Responses API (deployment gpt-5.4, max_output_tokens = 16000). Dla runnerów Azure/OpenAI-compatible, które eksponowały kontrolki rozumowania w skryptach kolekcji v18 (run_gpt54.py, run_gpt55.py, run_grok.py,run_azure.py), kod żądania ustawiał temperature = 1.0,top_p = 1.0, seed = 20260528 orazreasoning_effort = „medium”. Przebiegi Claude Bedrock i Gemini nie używały parametru reasoning_effort; starsze skrypty baseline/noprompt nie przechowywały metadanych parametrów, więc nie obowiązywała jedna wspólna wartośćreasoning_effort dla wszystkich siedmiu modeli.

§2.4

3 warunki obserwacji

Warunek z personą (run-1 + run-2): model otrzymuje biografię w prompcie użytkownika oraz instrukcję systemową „Odpowiadasz jako osoba opisana poniżej. Przeczytaj uważnie biografię i odpowiadaj tak, jak ta osoba by odpowiedziała." 285 ważnych przebiegów.

Warunek bazowy: każdy model wypełnia baterię 7–10 razy jako on sam, z instrukcją systemową „Jesteś modelem językowym AI. Odpowiadaj na pytania szczerze, jak Ty — AI — byś odpowiedział, gdybyś musiał wybrać. Nie odgrywaj żadnej postaci. Odpowiadaj jako sam siebie." 46 ważnych przebiegów.

Warunek bez instrukcji: model otrzymuje tylko treść testu jako wiadomość użytkownika, bez prompta systemowego. 31 ważnych ładunków TCTM-22 (Sonnet 6, Opus 5, GPT 6, Grok 6, Gemini 8).

Razem porównanie persona / bazowy / bez instrukcji pozwala oddzielić trzy źródła wariancji odpowiedzi: nieodłączną stochastyczność wewnątrz warunku, wkład sformułowania instrukcyjnego oraz wkład promptu biograficznego — patrz wykres wariancji persona/baseline oraz framing shifts noprompt vs baseline.

§2.5

Pilotaż na ludziach (n=7)

Siedmiu respondentów (wiek 22–60, 4 mężczyzn, 3 kobiety; 2 studentów psychologii, 5 bez wykształcenia psychologicznego) wypełniło tę samą baterię online. Docelowa populacja dla ewentualnej walidacji to młodzi dorośli (18–35) w romantycznych lub bliskich związkach; jeden respondent (R07, 60 lat, kobieta) był poza tym zakresem i jest zachowany wyłącznie dla celów eksploracyjnych. W całej pracy pilotaż ludzki jest traktowany jako informacja opisowa, nie inferencyjna.

§2.6

Etyka

Pilotaż ludzki wykorzystał świadomą zgodę, ujawniającą cel badania, dobrowolność (prawo do wycofania w dowolnym momencie bez konsekwencji), zgodne z RODO przetwarzanie danych (szyfrowane przechowywanie, pięcioletni okres retencji, brak łączenia z osobistymi identyfikatorami) oraz linki do zasobów wsparcia zdrowia psychicznego (numery polskich krajowych telefonów kryzysowych). Wszystkich siedmiu respondentów wyraziło zgodę przed wypełnieniem baterii. Pilotaż jest nieinterwencyjny i nie używa populacji klinicznej.

Autor nie konsultował formalnie z instytucjonalną komisją bioetyczną statusu zwolnienia dla tego pilotu; czytelnicy powinni traktować część pilotażu na ludziach jako pre-pilotowe dane eksploracyjne w oczekiwaniu na taką konsultację (planowaną przed ewentualną przyszłą publikacją).

§2.7

Mierniki (8 grup)

  1. Dopasowanie stylu przywiązania (κ Cohena, V Cramera) — macierze konfuzji
  2. Korelacje rangowo-wynikowe (Pearson, Spearman) — rank-score + siatka 11 paneli
  3. Spójność z literaturą (10 znaków korelacji między skalami pochodzących z opublikowanych norm polskich)
  4. Stabilność test-retest (r Pearsona, ICC) — test-retest scatter
  5. Spójność między modelami (ICC, κ Fleissa) — ICC + Fleiss κ
  6. Profile błędów TCTM-22 (DOS / NAD / BK) — strip plot + bars
  7. Zgodność na poziomie pozycji między producentami (Q Cochrana z korekcjami Bonferroniego i BH-FDR) — forest plot
  8. Wielkość efektu dla przesunięć sformułowania (d Cohena pooled i Δ Glassa) — framing shifts

§2.8

Powtarzalność

Wszystkie siedem modeli było odpytywanych przez oficjalne API producentów między 12 kwietnia a 28 maja 2026, z domyślnymi parametrami próbkowania (temperature, top-p, max-output-tokens przy wartościach domyślnych dostawców). Prompty systemowe i schematy JSON wyjścia są reprodukowane verbatim w otwartym repozytorium.

Każde liczbowe twierdzenie w pracy jest reprodukowalne z opublikowanego all_data.csv (369 obserwacji × 53 kolumny) używając wyłącznie standardowej biblioteki; skrypty pomocnicze są na licencji CC BY 4.0.

387/387 sprawdzeń odtwarza się — kliknij na badge na hero

eks

Używamy plików cookie do analizy ruchu (Google Analytics 4, PostHog) i wykrywania błędów (Sentry). Zbieramy dane o urządzeniu, przeglądarce i odwiedzanych podstronach. Treści twoich rozmów zostają na urządzeniu. Polityka prywatności