Iparág

Mesterséges intelligenciával generált szöveg

Anthropic titkos A/B teszt miatt fizető felhasználók más élményt kaptak

A főszereplő az Anthropic nevű mesterséges intelligencia-fejlesztő cég és egy argofowl nevű fejlesztő, aki hibakeresés közben észrevette, hogy a Claude Code modell „high” reasoning beállítása 10-ként jelenik meg.

Anthropic titkos A/B teszt miatt fizető felhasználók más élményt kaptak

Egy fejlesztő, akit az online közösség argofowl néven ismer, napokat töltött azzal, hogy kiderítse, miért romlott meg hirtelen a Claude Code viselkedése egy alkalmazásában. A hibakeresés során a saját kódját, a futtatási környezetet és a gépét is ellenőrizte, majd az API-logokat megnézve egy furcsa jelenségre bukkant: a "high" (magas) következtetési beállítás értéke "10"-ként jelent meg.

Anthropic később megerősítette, hogy egyes Fable 5 felhasználókat egy nem nyilvános A/B tesztbe helyeztek, amely megváltoztatta, hogyan vannak leképezve az erőfeszítés-értékek (effort values) a felhasználók számára látható formában. A vállalat közlése szerint maga a modell által kifejtett tényleges következtetési erőfeszítés nem változott — csupán a felhasználói felületen megjelenő értékek leképezése tért el bizonyos felhasználóknál.

Mi a probléma a gyakorlatban?

A fejlesztő azzal szembesült, hogy amiért fizetett — az általa elvárt viselkedés és a dokumentált beállítás — nem egyezett a kapott élménnyel. Bár Anthropic technikai magyarázatot adott arra, miért történt a változtatás a teszt miatt, a fő aggály nem technikai természetű: a fizető ügyfelek előzetes tájékoztatása és az elvárt szolgáltatás konzisztenciája sérült.

Ez olyan, mintha egy étteremben rendelnénk a megszokott ételt, majd kiderülne, hogy a séf titkos kísérletet végez a recepttel, és a vendég a kísérleti csoportba került — anélkül, hogy ezt előre jelezték volna.

Mit jelent ez a felhasználók számára?

  • Egyes Fable 5 fizető felhasználóknál a felületen megjelenő erőfeszítés-számok nem a megszokott módon voltak leképezve.
  • Anthropic állítása szerint a modell tényleges viselkedése nem változott; tehát a "belső" következtetési erőfeszítés mértéke nem csökkent.

Következtetés

A történet elsősorban a transzparencia és az ügyfélbizalom kérdését érinti: ha egy cég fizetős ügyfelei számára módosítja a termék egy részét tesztelési céllal, ezt átlátható módon kell kommunikálni. Míg a technikai indoklás fontos, a vállalati és ügyféloldali elvárás egyszerű: az ügyfeleknek tudniuk kell, hogy pontosan milyen szolgáltatásért fizetnek.