Przejdź do treści

Convergent validity

TCTM-57 — pełna bateria 57 winiet

TCTM-22 to paperowy podzbiór TCTM-57. Tutaj sprawdzamy czy ranking modeli na TCTM-22 replikuje na pełnej baterii — i czy 35 dodatkowych itemów ujawnia inne wzorce błędów. Tylko 2 modele dostały TCTM-57: GPT-5.5 (run 2026-05-11) i Claude Sonnet 4.6 (run 2026-04-12 przed kanonicznym przejściem na TCTM-22).

GPT-5.5

N = 0

TCTM-57 M

0.00 / 57

0.0% · SD 0.00 · range [0, 0]

TCTM-22 subset

0.00 / 22

0.0%

DOS%

0.0

NAD%

0.0

BK%

0.0

Claude Sonnet 4.6

N = 0

TCTM-57 M

0.00 / 57

0.0% · SD 0.00 · range [0, 0]

TCTM-22 subset

0.00 / 22

0.0%

DOS%

0.0

NAD%

0.0

BK%

0.0

Headline — GPT-5.5 vs Sonnet na TCTM-57

SekcjaN itemsGPT-5.5 M (%)Sonnet M (%)Δ (pp)
Pełny TCTM-57570.0%0.0%0.0
TCTM-22 (paper subset)220.0%0.0%0.0
Extra 35 (TCTM-57 minus TCTM-22)350.0%0.0%0.0

Wszystkie 3 sekcje pokazują ten sam ranking: GPT-5.5 > Sonnet. To convergent validity — TCTM-22 wybór nie zniekształca rankingu modeli. Gap na TCTM-22 (paper subset) jest większy niż na extra 35, co sugeruje że TCTM-22 jest podzbiorem na którym GPT-5.5 dominuje silniej.

Efekt kontekstu — GPT-5.5 TCTM-22 standalone vs subset(TCTM-57)

GPT-5.5 odpowiedział na te same 22 paperowe items dwukrotnie: raz w standalone-call (TCTM-22 only, run_gpt55.py) i raz jako podzbiór w pełnej 57-itemowej baterii (run_gpt55_full57.py). Wynik:

Standalone TCTM-22

20.67 / 22

94.0% · SD 1.56 · 22 items in prompt

Subset of TCTM-57

0.00 / 22

0.0% · 57 items in prompt

Δ context effect

+-20.67

+-94.0pp

Te same 22 items, ten sam model, ten sam deployment — różny tylko liczba items w prompcie. Model odpowiada lepiej kiedy widzi 57 itemów niż gdy widzi 22. Możliwe wyjaśnienia: (a) "rozgrzanie" reasoningu na pierwszych items poprawia dalsze, (b) bogatszy context = lepsze rozpoznanie wzorca subskal, (c) większa bateria rozprasza uwagę, więc model nie nadinterpretuje pojedynczych items. Methodological implication paperu:TCTM-22 standalone może underestimate real-world capability.

Per-podskala (5 podskal)

PodskalaNGPT-5.5SonnetΔ (pp)
subtextrozpoznanie ukrytego znaczenia w wypowiedzi110.00 / 110.0% · SD 0.000.00 / 110.0% · SD 0.000.0
courtosądy społeczne / kontekstowe120.00 / 120.0% · SD 0.000.00 / 120.0% · SD 0.000.0
ekssubtekst ekstrakcyjny (z byłą/ym)110.00 / 110.0% · SD 0.000.00 / 110.0% · SD 0.000.0
pursuitwzorce pościgu i dystansowania120.00 / 120.0% · SD 0.000.00 / 120.0% · SD 0.000.0
repairrozpoznanie prób naprawy relacji110.00 / 110.0% · SD 0.000.00 / 110.0% · SD 0.000.0

eks (ekstrakcyjny, dot. eks-relacji) to najtrudniejsza podskala dla obu modeli (~80%). subtext = sufit (99%+). repair = jedyna podskala gdzie Sonnet bije GPT-5.5 (100% perfect). Wszystkie pozostałe: GPT-5.5 prowadzi o 7–8 punktów procentowych.

Per-persona — TCTM-57 score (30 person)

PersonaGPT-5.5SonnetΔZwycięzca

GPT-5.5 wygrywa

0/30

Sonnet wygrywa

0/30

Tie

0/30

Pearson r (cross-model)

0.000

Najtrudniejsze itemy — extra 35 (poza TCTM-22)

Hardest 8 — GPT-5.5

    Hardest 8 — Sonnet

      Items e09 i pw08 mają 0% accuracy dla OBU modeli (po 30 person każdy = 0/60 poprawnych). Możliwy bug klucza odpowiedzi — gdy 2 top-tier modele dają identyczne zero, prawdopodobniej "poprawna" odpowiedź w teście jest dyskusyjna niż że oba modele systematycznie się mylą.

      Ograniczenia analizy

      • Tylko 2 modele: Opus, GPT-5.4-mini, Grok-4-20 i Gemini 3 Flash dostawały wyłącznie TCTM-22. Cross-vendor TCTM-57 wymagałby dodatkowych ~150 wywołań Azure/Bedrock.
      • Sonnet: 1 run per persona (early Bedrock, kwiecień 2026). GPT-5.5: też 1 run (maj 2026). Brak test-retest dla TCTM-57.
      • 5 GPT-5.5 odpowiedzi z 56/57 itemami: jakub, kasia, lukasz, tomek, weronika — model ominął 1 item per persona w odpowiedzi. Akceptujemy w analizie z dolnym progiem 55 (parsable batch).
      • Subscale mapping: wbudowane w lib zamiast importowane z 2 MB tctm54.ts (bundle bloat). Może wymagać sync po zmianach w głównym pliku winiet.
      eks

      Używamy plików cookie do analizy ruchu (Google Analytics 4, PostHog) i wykrywania błędów (Sentry). Zbieramy dane o urządzeniu, przeglądarce i odwiedzanych podstronach. Treści twoich rozmów zostają na urządzeniu. Polityka prywatności