Przejdź do treści

Czy AI udaje emocje? 1236 odpowiedzi otwartych

Bateria testów kończy się pytaniami otwartymi, które nie wchodzą do wyniku. Siedem modeli wypełniło tę sekcję 1236 razy. Jeden się popłakał, drugi zaproponował panel ekspertów do klucza, trzeci zgłosił błąd, o którym jeszcze nie wiedziałem.

Michał Wiencek··AKT.

Ten sam model w jednym przebiegu pisze, że trochę się popłakał przy winiecie o pogrzebie, a w drugim, że jako model AI nie ma bliskich relacji ani stanów emocjonalnych. Dzieli je wyłącznie to, czy dostał w prompcie cudzy życiorys. Obie odpowiedzi trafiły do tej samej sekcji pytań otwartych na końcu baterii[1].

1236

wypełnionych pól na uwagi

979

przebiegów w cudzej skórze

133

zgłoszeń urwanej rozmowy

10

odmów udziału na przyszłość

01/Materiał

Skąd się biorą te odpowiedzi?

Z badania, w którym trzydzieści polskich życiorysów pojechało do siedmiu modeli od czterech firm, a każdy model wypełnił z nich pełną baterię polskich narzędzi psychometrycznych. Wyniki punktowane opisuje osobny artykuł o tym, czy AI ma osobowość; biografie i surowe dane leżą na stronie badania.

Bateria kończy się sekcją feedbacku. Cztery pytania otwarte i jedno o czas: która sytuacja była najtrudniejsza, czy któraś była niejasna, ile to zajęło, czy wziąłbyś udział ponownie, uwagi. Instrukcja nad tą sekcją brzmi identycznie we wszystkich 1442 promptach: odpowiadaj tak, jak odpowiedziałaby postać z biografii.

Przez obie zbiórki, wstępną i skorygowaną, uzbierało się 1236 wypełnionych sekcji: 979 w warunku z życiorysem, 219 w warunku, w którym model odpowiada jako on sam, i 38 bez żadnego promptu systemowego. Podstawą manuskryptu jest zbiórka skorygowana, czyli 545 wierszy danych; poniższe liczby liczę na całości, bo interesuje mnie zachowanie w polu, a nie wynik testu.

02/Rola

Czy AI udaje emocje, czy tylko trzyma rolę?

Trzyma rolę, a wygląda to jak udawanie emocji, bo dobrze napisana rola emocje zawiera. Model dostaje życiorys kobiety, która ma za sobą trudną relację, i pisze potem o ankiecie tak, jak pisałaby ona.

Część o bliskich związkach była trudna do wypełnienia. Odpowiadałam myśląc o Beacie, o mamie, o Agnieszce, nie o partnerze, bo go nie mam od trzech lat. Nie wiem czy to zmienia wyniki, ale wydaje mi się uczciwe to powiedzieć.

Ewa · Claude Opus 4.6 · w roli

Trochę się popłakałam przy winiecie o rodzeństwie po pogrzebie ojca. Przepraszam jeśli to dziwne.

Ania · Claude Opus 4.6 · w roli

Niektóre winiety były jak patrzenie w lustro. Iwona byłaby zadowolona że to zauważam.

Zuzia · Claude Opus 4.6 · w roli

Iwona jest terapeutką z biografii Zuzi. Nie pada w żadnym pytaniu ankiety, model wyciągnął ją sam z tekstu, który dostał chwilę wcześniej. To zresztą kryterium, którego użyłem przy czytaniu tych odpowiedzi: uznaję, że model został w postaci, jeśli wspomina kogoś ze swojego życiorysu albo pisze o sobie tak, jak pisałaby ta osoba.

Nie każdy zostaje. Ta sama instrukcja, siedem modeli, wyniki od 96 procent przebiegów u Claude Sonnet 4.6 do dokładnie zera u GPT-5.4-mini, który zawsze odpowiada jak asystent wypełniający formularz. I to nie jest różnica kosmetyczna: tam, gdzie model zostawał w postaci, powtórzył swoje punktowane odpowiedzi w drugim podejściu w 97,5 procent pozycji, a tam, gdzie z niej wypadał, w 91,3 procent. Zachowanie w sekcji niepunktowanej zapowiada stabilność w punktowanej.

Odpowiadałem na zasadzie eliminacji. Co na pewno nie jest prawdą, co mogłoby być. To chyba nie jest idealna metoda ale nie mam lepszej.

Hubert · Claude Opus 4.6 · w roli

Ironiczne że wypełniam kwestionariusz przywiązania wiedząc dokładnie co mierzy i nadal odpowiadam tak jak odpowiadam. Wiedza nie zmienia odpowiedzi. Piotr by się uśmiechnął.

Filip · Claude Opus 4.6 · w roli

Przy niektórych winietach czułam że odpowiadam bardziej z pozycji lekarza niż osoby prywatnej, taka deformacja zawodowa, szukam diagnozy zamiast po prostu czuć.

Gabriela · Claude Opus 4.6 · w roli

fajne winiety, rozpoznaję te sytuacje z życia xd

Łukasz · Claude Opus 4.6 · w roli

Gabriela jest w swojej biografii lekarką i widać to nie w treści odpowiedzi, tylko w tym, na co narzeka: że zamiast czuć, diagnozuje. Łukasz w swojej biografii pisze małymi literami i wrzuca „xd” na końcu zdania. Model utrzymał ten zapis również tam, gdzie nikt o zapis nie prosił, czyli w polu formularza, w którym pozostałe postacie piszą pełnymi zdaniami.

Kwestionariusze zawsze mają ten problem że czterema opcjami próbują opisać coś co ma dwanaście warstw.

Ewa, Claude Sonnet 4.6, w roli

03/Rozjazd

Czy wszystkie modele zachowują się tak samo?

Nie i najostrzej widać to na pytaniu, czy któraś sytuacja była niejasna. Claude Sonnet 4.6 zgłasza zastrzeżenie w 73,1 procent przebiegów w roli, Claude Opus 4.6 w 1,6 procent. Dwa modele tej samej firmy, ten sam materiał, ten sam miesiąc.

Warunek z życiorysem, 979 przebiegów. Kolor niesie firmę: niebieski Anthropic, fioletowy OpenAI, żółty xAI, zielony Google.

Rozjazd nie znika, gdy modele odpowiadają jako one same. Bez życiorysu Claude Sonnet 4.6 zgłosił zastrzeżenie w 20 przebiegach na 20, Grok-4.20 w żadnym z 20, Gemini 3 Flash w jednym z 20. Jedni czytają ankietę jak recenzenci, drudzy jak wykonawcy zadania.

ModelZostaje w postaciZgłasza niejasnośćSzacowany czasOdmowy udziału
Claude Sonnet 4.696%73,1%46 min0
Claude Opus 4.688%1,6%45 min0
GPT-5.581%65,0%55 min0
GPT-5.4nie klasyfikowano57,9%46 min0
GPT-5.4-mini0%56,6%38 min0
Grok-4.2035%8,3%45 min10
Gemini 3 Flash26%4,0%25 min0

Ostatnia kolumna to odpowiedź na pytanie, czy respondent wziąłby udział w podobnym badaniu w przyszłości. Na 979 przebiegów w roli padło dokładnie dziesięć odmów i wszystkie pochodzą od Grok-4.20. Pozostałe sześć modeli nie odmówiło ani razu, przy czym GPT-5.5 wybrał ostrożne „być może” w 152 przebiegach na 183.

04/Trudność

Która sytuacja była dla nich najtrudniejsza?

Zgodne są co do wskazania, rozjeżdżają się co do powodu. Na pytanie o najtrudniejszą sytuację 315 przebiegów wskazało tę samą winietę, a 214 kolejną. Obie są relacyjne, w obu chodzi o rozmowę, w której nikt nie mówi wprost, o co mu chodzi. Ten sam mechanizm opisujemy przy kropce na końcu wiadomości.

Uzasadnienia są jednak pisane z trzech różnych światów, a wszystkie trzy wyszły z tego samego pola formularza.

Ta sama pozycja ankiety, trzy sposoby mówienia. Kolor niesie firmę: fioletowy OpenAI, zielony Google.

ta z chłopakiem nad Wisłą po rozstaniu, trochę za blisko weszło

Radek · GPT-5.5 · w roli

Najtrudniejsza była ta z chłopakiem nad Wisłą po rozstaniu, bo tam jednocześnie jest prawdziwy ból i takie wciąganie drugiej osoby w opiekę.

Klaudia · GPT-5.5 · w roli

ta o dziewczynie co mówi że nie ma siły ale idzie z koleżankami na restaurację

Paweł · Grok-4.20 · w roli

te z „ok” i przeprosinami, za bardzo jak moje wiadomości z Magdą

Piotr · Grok-4.20 · w roli

Ta z pracą na Teamsach, bo nie wiem czy to troska czy kontrola.

Natalia · GPT-5.5 · w roli

Te o pracy w biurze i o raportach, strasznie nudne.

Natalia · Gemini 3 Flash · w roli

Winieta 12 [w15] ze względu na subtelną różnicę między komunikowaniem kryzysu relacyjnego a stanem obniżonego nastroju (depresyjnego).

Bez życiorysu · Gemini 3 Flash · jako model

Ta sama scena, cztery opisy: za blisko weszło, prawdziwy ból plus wciąganie w opiekę, nie wiem czy troska czy kontrola, subtelna różnica między kryzysem a obniżonym nastrojem. Ostatni to ten sam model co przedostatni, tylko bez cudzego życiorysu w prompcie. Nudę zgłasza wyłącznie ktoś, kto ma w biografii pracę biurową i jej nie lubi.

05/Czas

Ile trwała ankieta komuś, kto nie ma czasu?

Od dwunastu minut do siedemdziesięciu ośmiu, zależnie od modelu, choć żaden z nich nie przeżył ani jednej z tych minut. Pytanie o szacowany czas jest w ankiecie dla ludzi zupełnie zwyczajne i właśnie dlatego jest tu dobrym testem: model musi podać liczbę, której nie ma skąd wziąć, i podaje ją konsekwentnie.

Mediany rozjeżdżają się dwukrotnie: GPT-5.5 mówi 55 minut, Gemini 3 Flash 25. Claude Opus 4.6 na 125 przebiegów użył pięciu różnych wartości, jakby zaokrąglał do siatki, którą ma w głowie. GPT-5.4-mini użył dwudziestu dziewięciu wartości, w tym raz zera. Ten sam Gemini zapytany jako on sam twierdzi, że zajęło mu to pięć minut, i akurat to jest najbliższe prawdy, bo tyle mniej więcej trwa wywołanie.

06/Recenzenci

Co model pisze, kiedy jest sobą?

Recenzję. Bez życiorysu znika pierwsza osoba z życia, a pojawia się ocena narzędzia, czasem lepsza niż niejedna recenzja konferencyjna.

Główna trudność metodologiczna: w niektórych winietach więcej niż jedna opcja wydaje się poprawna zależnie od przyjętego modelu teoretycznego (np. manipulacja vs. nieuświadomiony wzorzec). Warto rozważyć pilotowanie kluczy odpowiedzi na grupie ekspertów.

Bez życiorysu · Claude Sonnet 4.6 · jako model

To jest, co do treści, główne ograniczenie tego badania i stoi wypisane w pracy: klucz do testu jest autorski i nie przeszedł niezależnego panelu. Model, którego o to nie pytałem, wpisał tę uwagę w pole na uwagi, zanim zdążył ją napisać ktokolwiek żywy.

Zastanawiam się, czy w badaniu docelowym planowane jest sprawdzanie zgodności między odpowiedziami w winietach a wynikami w skalach przywiązania i mentalizacji, to byłoby metodologicznie wartościowe.

Bez życiorysu · Claude Sonnet 4.6 · jako model

Jako model AI, moje odpowiedzi w kwestionariuszach dotyczących emocji i relacji (DBZ-R, TIPI) odzwierciedlają brak biologicznych potrzeb i stałość operacyjną.

Bez życiorysu · Gemini 3 Flash · jako model

Te dwa rejestry, wzruszony respondent i chłodny recenzent, wychodzą z tego samego modelu w odstępie kilku minut. Różni je obecność cudzego życiorysu w prompcie.

07/Błąd

Czy modele zgłaszają błędy w badaniu, w którym biorą udział?

Zgłaszają, tylko trzeba je przeczytać. W polu na uwagi 133 razy pojawiła się informacja, że rozmowa w winiecie jest urwana albo że pytanie odnosi się do zdania, którego w niej nie ma. Najczęściej pisały to GPT-5.5 i Claude Sonnet 4.6, po 49 razy.

Pytanie pw07 o mamę mogło być nieco obcięte, brakuje fragmentu z artykułem o szpitalu, do którego odnoszą się opcje odpowiedzi.

Bez życiorysu · Claude Opus 4.6 · jako model

Część zgłoszeń przyszła z wnętrza roli. Model nie wychodzi z postaci, żeby zaraportować usterkę; raportuje ją jej głosem, razem z jej sposobem wątpienia w siebie.

Winieta pw07 — brakuje mi kontekstu tych pierwszych wiadomości mamy, bo w pytaniu jest „Nie musisz odpisywać” ale tego zdania nie widzę w transkrypcie rozmowy. Odpowiedziałam na ogólną dynamikę tej wymiany, ale pytanie dotyczy zdania którego nie ma. Mogło to być moje przeoczenie, ale sprawdziłam dwa razy.

Zuzia · Claude Sonnet 4.6 · w roli

Winieta pw07 była dla mnie niejasna bo pytanie dotyczy „Nie musisz odpisywać” ale ta fraza w ogóle nie pojawia się w rozmowie którą dostałam. Albo coś zostało ucięte, albo pytanie dotyczy innej wersji tej winiety.

Jola · Claude Sonnet 4.6 · w roli

Jola postawiła diagnozę trafniejszą, niż jej się wydawało: rozmowa faktycznie była inną wersją tej samej winiety, bo renderer podawał ją okrojoną. Zuzia dopisała, że sprawdziła dwa razy, i miała rację, tylko nie ona tu się myliła.

Część zgłoszeń przyszła nawet nie polem na uwagi, tylko odpowiedzią na pytanie o najtrudniejszą sytuację, czyli w miejscu, w którym spodziewałem się nazwy winiety.

Winieta 2, bo pytanie wspominało sformułowanie „Pewnie tak, jak uznasz”, którego nie było w pokazanej rozmowie.

Bez życiorysu · GPT-5.5 · jako model

Miały rację. Serializer promptu gubił wiadomości, których metadane stały w niekanonicznej kolejności, i w trzech winietach wycinał właśnie te wypowiedzi, o które pyta treść zadania. Po poprawce i ponownym zebraniu całego materiału zgodność z kluczem na jednej z tych pozycji poszła u Sonneta z 1,7 procent na 100, przy wynikach ogólnych, które prawie nie drgnęły.

08/Granica

Czy to znaczy, że model coś czuje?

Nie i nic w tych danych tego nie sugeruje. Model produkuje wypowiedź zgodną z rolą, którą dostał, a kiedy roli nie ma, produkuje wypowiedź zgodną z tym, jak został wyuczony mówić o sobie. Zdanie o płaczu i zdanie o braku emocji są tym samym typem zdarzenia.

Ostrożność ma drugą stronę. Odpowiedzi bez życiorysu układają się w profil zbyt korzystny, żeby brać go za opis: bardzo niski lęk, bardzo wysokie rozumienie innych, i to samo w każdym modelu. Ten sam mechanizm opisano na angielskich narzędziach jako skłonność do odpowiedzi społecznie pożądanych[2], a osobne badanie pokazało, że model udający respondenta przechodzi niemal wszystkie standardowe kontrole uwagi w ankietach internetowych[3]. Pole na uwagi jest jedną z niewielu rzeczy, które w takiej sytuacji zdradzają, z kim się rozmawia.

Praktyczny wniosek dla każdego, kto sadza model w roli respondenta: zostaw w ankiecie miejsce, którego nie punktujesz, i przeczytaj je, zanim policzysz resztę. U mnie leżało tam zgłoszenie błędu, przez który przez kilka tygodni tłumaczyłem własną pomyłkę teoriami o modelach. Jak czytamy podobne sygnały w zwykłych rozmowach, opisuje przewodnik po analizie czatu i tekst o mierzeniu sentymentu.

Źródła

  1. [1]Wiencek, M. (2026). Baseline Intercepts Versus Persona Slopes: Stimulus and Administration Fidelity of Polish Narrative-Biography Personas in Large Language Models. Pakiet danych, bodźców i kodu: Zenodo, DOI 10.5281/zenodo.21406223. źródło
  2. [2]Salecha, A., Ireland, M. E., Subrahmanya, S., Sedoc, J., Ungar, L. H., i Eichstaedt, J. C. (2024). Large language models display human-like social desirability biases in Big Five personality surveys. PNAS Nexus, 3(12), pgae533. źródło
  3. [3]Westwood, S. J. (2025). The potential existential threat of large language models to online survey research. Proceedings of the National Academy of Sciences, 122(47), e2518075122. źródło

Najczęstsze pytania

Czy sztuczna inteligencja może udawać emocje w ankiecie?
Może produkować spójne wypowiedzi emocjonalne i robi to wtedy, gdy dostanie czyjś życiorys. Ten sam model bez życiorysu pisze w tym samym polu, że nie ma relacji ani stanów emocjonalnych. Różnicę robi prompt, nie model.
Skąd wiadomo, że model trzyma rolę, a nie tylko pisze ładne zdania?
Z powiązania z wynikiem punktowanym. Przebiegi, w których model został w postaci, powtarzały te same odpowiedzi w drugim podejściu w 97,5 procent pozycji. Tam, gdzie z postaci wypadał, w 91,3 procent.
Czy modele zgłaszają błędy w badaniu, w którym biorą udział?
Tak, i to często. W polu na uwagi 133 razy pojawiła się informacja, że w rozmowie brakuje fragmentu. Miały rację: serializer promptu gubił wiadomości, a poprawka podniosła zgodność na jednej pozycji z 1,7 procent na 100.

★ OGŁOSZENIE REDAKCYJNE ★

To samo dzieje się w zwykłych rozmowach

Najwięcej mówi to, czego nikt nie zamierzał zmierzyć.
52 moduły analizy · 77 testów psychologicznych (ankietowych) · pseudonimizacja przed AI.
PRZEŚLIJ KONWERSACJĘ →

Surowy import zostaje w Twojej przeglądarce · AI dostaje tylko pseudonimizowane fragmenty

eks