Az elmúlt napokban több nagy nyelvi modell-frissítés jelent meg. Egy korábbi körben Grok 4.7 és MiMo v2.6 Flash/Pro érkezett, majd most Anthropic kiadta Claude Opus 5.5-öt; körülbelül egy órával később pedig OpenAI bemutatta a GPT-6 Sol és GPT-6 Luna modelleket. A részletes teszteléshez idő kell, de a korai tapasztalatokból világos, hogy jelentős árváltozások és viselkedésbeli különbségek látszanak.
Árazási változások — lényeges csökkenések
A legszembeötlőbb változás az árakban van. A GPT-6 Luna és GPT-6 Sol ára lényegesen alacsonyabb a GPT-5.6 megfelelőinél: többek között a GPT-6 Luna inputja most 0,10 USD/millió token, cache input 0,01 USD/millió, output pedig 0,50 USD/millió. Ezzel összehasonlítva a GPT-5.6 Luna árai 0,20/0,02/1,20 USD/millió voltak (input/cached input/output).
A cikkben közölt további példák a következők:
- Grok 4.7: 2 USD/millió input, 0,50 USD/millió cached input, 6 USD/millió output
- GPT-6 Sol: 2 / 0,20 / 10 USD/millió
- GPT-5.6 Terra: 2 / 0,20 / 12 USD/millió
- Claude Opus 5.5: 4 / 0,20 / 20 USD/millió
- GPT-5.6 Sol: 4 / 0,40 / 20 USD/millió
- Claude Fable 5.1: 10 / 0,25 / 50 USD/millió
- GPT-6 Astra: 10 / 1 / 50 USD/millió
Fontos kontextus, hogy GPT-5.6 modellekhez volt ütemezve 25%-os áremelés novemberre, így a GPT-6 modellek ára valójában a promócionális 5.6-hoz képest is kedvezőbbnek tűnik. A GPT-5.6 Terra ára és a GPT-6 Sol ára azonos szinten volt, így a GPT-6 bevezetése megszüntette a Terra használatának akármilyen ár-alapú indokát.
A GPT-6 Luna árszintje (0,10/0,50) az OpenAI történetében az egyik legalacsonyabb, csak néhány gyengébb, korábbi Nano-osztályú modell ára volt ennél alacsonyabb.
Anthropic: Opus 5.5 és árcsökkentés
Anthropic szerint Opus 5.5 azokra a visszajelzésekre épül, amelyek az Opus kommunikációs stílusát kritizálták. Thariq Shihipar megjegyzése alapján Opus 5.5 egyértelműbben kommunikál, token-hatékonysága jobb, és az intelligenciáját tekintve a Fable 5.1-re emlékeztet. Emellett állítólag jobban teljesít a „Blender” jellegű feladatoknál.
Árban az Opus család eddigi tagjai (4.5–5) 5 USD/millió input és 25 USD/millió output áron voltak. Opus 5.5 ezeket 20%-kal csökkentve 4 USD/millió inputra és 20 USD/millió outputra hozta le. A cache read (cache-ból olvasott input) ára még jelentősebb mértékben esett (60%), ami hosszabb, ügynök-szerű beszélgetéseknél nagy hatással lehet, mivel ezeknél gyakran a bemeneti tokenek többsége cache-ként kerül feldolgozásra.
A mostani árszintek alapján Opus 5.5 ára megegyezett a GPT-5.6 Sol korábbi árával — azonban ez az egyensúly felborult, miután OpenAI a Sol modellek árát tovább csökkentette.
Anthropic jelezte, hogy Sonnet 5.5 és Haiku 5.5 is érkezik hamarosan; kérdéses, hogy a Haiku visszanyerheti-e árversenyképességét az alsó kategóriában, tekintve hogy jelenleg Haiku 4.5 ára 1/5 USD/millió, míg az új GPT-6 Luna 0,10/0,50 USD/millió.
Teljesítési tapasztalatok: Opus 5.5 túl sokat „gondolkodott” egy SVG-példán
A gyakorlatban Opus 5.5-nél előjött egy működésbeli probléma: egy egyszerű feladatra — "Generate an SVG of a pelican riding a bicycle" — a Claude Opus 5.5 "max" gondolkodási szinten nem adott választ. A modell részletes, iteratív belső tervezésbe kezdett, erősen részletező és számszerűsítő belső taxonómiákat és geometriát írva (például sípcsont hosszát, lábmozgást, pedálhoz illeszkedés koordinátáit, réteg-rendeket, viewBox méretezést stb.), majd elérte a modell 128 000 maximális kimeneti token korlátját miközben még mindig a készítés közben volt.
A tesztismétlés ugyanilyen eredményre vezetett: a "max" beállításnál a túlzott belső reasoning végül megszakította a választ. Két ilyen kudarc körülbelül 2,56 USD-be került összesen, és mindkettő közel 20 percig tartott. Ez arra enged következtetni, hogy a "max" szint túl sok belső számítást végezhet, ami egyes egyszerű feladatoknál kontraproduktív lehet.
Ezzel szemben Claude Fable 5.1 "max" beállításon nem akadt el, és a cikkíró szerint az Fable 5.1 hozta a legjobb pelican-ábrát az Anthropic-modellek közül.
Vizualizációk és összehasonlítások
A szerző külön SVG-pelicanokat renderelt GPT-6 Luna és GPT-6 Sol alatt, valamint Opus 5.5, Opus 5, Fable 5.1 és Sonnet 5 pelicanokkal készített összehasonlító rácsot. Szemrevételezés alapján a 5.6 család élénkebb, merészebb színeket használt, míg a 6-os család mutatósan visszafogottabb tónusokat alkalmazott; a szerző személyes preferenciája szerint a GPT-6 Astra maximális beállításon adta a legjobb pelicant.
Gyakorlati használat
A szerző mostantól alapértelmezettként a GPT-6 Sol-t és a Claude Opus 5.5-öt használja a Codex és Claude Code munkafolyamataihoz. A Datasette Agent demóját (agent.datasette.io) frissítette GPT-6 Luna használatára; a tesztek alapján a Luna gyors és kompetens SQL-lekérdezésekben, valamint HTML és JavaScript generálásban a Datasette Apps-hez.
Összegzés
A gyors árcsökkentések és az új modellek megjelenése jelentős piaci mozgást okoz: az alsó és középszintű modellek ára különösen lejjebb ment, ami gyorsan módosítja a korábbi választási szempontokat. Ugyanakkor a teljesítmény oldalán is látszanak különbségek: Opus 5.5 javított kommunikációban és token-hatékonyságban, de a "max" reasoning mód túlzott belső gondolkodása problémás lehet bizonyos feladatoknál. A verseny folytatódik, Anthropic további 5.5-ös kiadásokra készül, és a felhasználók hamarosan több adat alapján hozhatnak döntést arról, mely modellek érdemesek a mindennapi alkalmazásokhoz.



