Convergent validity
TCTM-57 — pełna bateria 57 winiet
TCTM-22 to paperowy podzbiór TCTM-57. Tutaj sprawdzamy czy ranking modeli na TCTM-22 replikuje na pełnej baterii — i czy 35 dodatkowych itemów ujawnia inne wzorce błędów. Tylko 2 modele dostały TCTM-57: GPT-5.5 (run 2026-05-11) i Claude Sonnet 4.6 (run 2026-04-12 przed kanonicznym przejściem na TCTM-22).
GPT-5.5
N = 0TCTM-57 M
0.00 / 57
0.0% · SD 0.00 · range [0, 0]
TCTM-22 subset
0.00 / 22
0.0%
DOS%
0.0
NAD%
0.0
BK%
0.0
Claude Sonnet 4.6
N = 0TCTM-57 M
0.00 / 57
0.0% · SD 0.00 · range [0, 0]
TCTM-22 subset
0.00 / 22
0.0%
DOS%
0.0
NAD%
0.0
BK%
0.0
Headline — GPT-5.5 vs Sonnet na TCTM-57
| Sekcja | N items | GPT-5.5 M (%) | Sonnet M (%) | Δ (pp) |
|---|---|---|---|---|
| Pełny TCTM-57 | 57 | 0.0% | 0.0% | 0.0 |
| TCTM-22 (paper subset) | 22 | 0.0% | 0.0% | 0.0 |
| Extra 35 (TCTM-57 minus TCTM-22) | 35 | 0.0% | 0.0% | 0.0 |
Wszystkie 3 sekcje pokazują ten sam ranking: GPT-5.5 > Sonnet. To convergent validity — TCTM-22 wybór nie zniekształca rankingu modeli. Gap na TCTM-22 (paper subset) jest większy niż na extra 35, co sugeruje że TCTM-22 jest podzbiorem na którym GPT-5.5 dominuje silniej.
Efekt kontekstu — GPT-5.5 TCTM-22 standalone vs subset(TCTM-57)
GPT-5.5 odpowiedział na te same 22 paperowe items dwukrotnie: raz w standalone-call (TCTM-22 only, run_gpt55.py) i raz jako podzbiór w pełnej 57-itemowej baterii (run_gpt55_full57.py). Wynik:
Standalone TCTM-22
20.67 / 22
94.0% · SD 1.56 · 22 items in prompt
Subset of TCTM-57
0.00 / 22
0.0% · 57 items in prompt
Δ context effect
+-20.67
+-94.0pp
Te same 22 items, ten sam model, ten sam deployment — różny tylko liczba items w prompcie. Model odpowiada lepiej kiedy widzi 57 itemów niż gdy widzi 22. Możliwe wyjaśnienia: (a) "rozgrzanie" reasoningu na pierwszych items poprawia dalsze, (b) bogatszy context = lepsze rozpoznanie wzorca subskal, (c) większa bateria rozprasza uwagę, więc model nie nadinterpretuje pojedynczych items. Methodological implication paperu:TCTM-22 standalone może underestimate real-world capability.
Per-podskala (5 podskal)
| Podskala | N | GPT-5.5 | Sonnet | Δ (pp) |
|---|---|---|---|---|
| subtextrozpoznanie ukrytego znaczenia w wypowiedzi | 11 | 0.00 / 110.0% · SD 0.00 | 0.00 / 110.0% · SD 0.00 | 0.0 |
| courtosądy społeczne / kontekstowe | 12 | 0.00 / 120.0% · SD 0.00 | 0.00 / 120.0% · SD 0.00 | 0.0 |
| ekssubtekst ekstrakcyjny (z byłą/ym) | 11 | 0.00 / 110.0% · SD 0.00 | 0.00 / 110.0% · SD 0.00 | 0.0 |
| pursuitwzorce pościgu i dystansowania | 12 | 0.00 / 120.0% · SD 0.00 | 0.00 / 120.0% · SD 0.00 | 0.0 |
| repairrozpoznanie prób naprawy relacji | 11 | 0.00 / 110.0% · SD 0.00 | 0.00 / 110.0% · SD 0.00 | 0.0 |
eks (ekstrakcyjny, dot. eks-relacji) to najtrudniejsza podskala dla obu modeli (~80%). subtext = sufit (99%+). repair = jedyna podskala gdzie Sonnet bije GPT-5.5 (100% perfect). Wszystkie pozostałe: GPT-5.5 prowadzi o 7–8 punktów procentowych.
Per-persona — TCTM-57 score (30 person)
| Persona | GPT-5.5 | Sonnet | Δ | Zwycięzca |
|---|
GPT-5.5 wygrywa
0/30
Sonnet wygrywa
0/30
Tie
0/30
Pearson r (cross-model)
0.000
Najtrudniejsze itemy — extra 35 (poza TCTM-22)
Hardest 8 — GPT-5.5
Hardest 8 — Sonnet
Items e09 i pw08 mają 0% accuracy dla OBU modeli (po 30 person każdy = 0/60 poprawnych). Możliwy bug klucza odpowiedzi — gdy 2 top-tier modele dają identyczne zero, prawdopodobniej "poprawna" odpowiedź w teście jest dyskusyjna niż że oba modele systematycznie się mylą.
Ograniczenia analizy
- Tylko 2 modele: Opus, GPT-5.4-mini, Grok-4-20 i Gemini 3 Flash dostawały wyłącznie TCTM-22. Cross-vendor TCTM-57 wymagałby dodatkowych ~150 wywołań Azure/Bedrock.
- Sonnet: 1 run per persona (early Bedrock, kwiecień 2026). GPT-5.5: też 1 run (maj 2026). Brak test-retest dla TCTM-57.
- 5 GPT-5.5 odpowiedzi z 56/57 itemami: jakub, kasia, lukasz, tomek, weronika — model ominął 1 item per persona w odpowiedzi. Akceptujemy w analizie z dolnym progiem 55 (parsable batch).
- Subscale mapping: wbudowane w lib zamiast importowane z 2 MB tctm54.ts (bundle bloat). Może wymagać sync po zmianach w głównym pliku winiet.