Dylan Castillo átfogó elemzést végzett annak megválaszolására, hogy a képgeneráló modelleket szándékosan "pelikanbiciklizésre" (pelican-on-bicycle) tanították-e — vagyis egyes laborok tudatosan előnyben részesítik-e a pelikanokat biciklin ábrázoló képeket. Az eredmény: nincs meggyőző bizonyíték arra, hogy ez történne.
Módszer
Castillo 8 különböző állat és 6 különböző jármű kombinációjából 48 promptot hozott létre (8 × 6 = 48). Minden promptot háromszor futtatott le hét különböző modellen: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 és DeepSeek V4 Pro. A létrejött képek eredményeit további két modelltípussal — GPT-5.6 Luna és Gemini 3.1 Flash-Lite — segítettek kiértékelni.
Castillo munkájában rendelkezésre áll egy szűrőnézet (filter view) az eredmények részletes vizsgálatához.
Eredmények
- Nem talált nyomokat arra, hogy a modellek jobban rajzolnának pelikanokat a többinél.
- A bicikliket sem rajzolják jobban, mint más járműveket.
- Amikor a két elemet — pelikan és bicikli — együtt vizsgálták, nem mutatkozott jelentős javulás a kombinációs cellában a modellek teljesítményéhez képest.
- A pelikan-bicikli jelenetek nem tűnnek memorizáltnak vagy ismétlődő, tanult sablonoknak.
Kivételnek nevezhető, hogy a GLM-5.2 modell mutatott a legnagyobb relatív javulást az "exakt pelican-on-bicycle" cellában, és az első pelikan-bicikli mintája feltűnő volt a szerző számára. Ugyanakkor ez a hatás kicsi és statisztikailag nem szignifikáns, ezért Castillo nem tulajdonít neki túl nagy jelentőséget.
Miért számít ez?
A kérdés régóta felmerül a közösségben: egyesek attól tartanak, hogy a laborok vagy adatkészletek torzítást (bias) alakítanak ki bizonyos, gyakran vicces vagy emlékezetes kép-összeállítások felé. Ez a vizsgálat rendszerezett, többmodelltesztelésen alapuló adatot nyújt, és azt mutatja, hogy a pelikanon-biciklin képek gyakoribbá tétele nem tűnik általános, tudatos gyakorlatnak az ellenőrzött modellek és minták alapján.
Következtetés
A jelen tesztelés szerint nincs megalapozott bizonyíték arra, hogy az AI-laborok szándékosan "pelicanmaxxolnák" a generált képeket. Bár egyes modelleknél (például GLM-5.2) megfigyelhető egy kis eltérés, az nem elég erős ahhoz, hogy általános következtetést vonjunk le.
Hivatkozás és meta
A vizsgálat ismertetése a Hacker News-on is megjelent. A témát kapcsolódó kulcsszavak: ai, generative-ai, llms, evals, pelican-riding-a-bicycle.



