Modellbevezetés

Mesterséges intelligenciával generált szöveg

GPT-6 és Claude Opus 5.5: új modellek és váratlan árverseny a nagy nyelvi modelleknél

Az Anthropic és az OpenAI a közelmúltban új modelleket jelentett be: Anthropic bemutatta a Claude Opus 5.5-öt, míg OpenAI egy órával később kiadta a GPT-6 Sol és GPT-6 Luna modelleket.

GPT-6 és Claude Opus 5.5: új modellek és váratlan árverseny a nagy nyelvi modelleknél

Az elmúlt napokban több nagy nyelvi modell-frissítés jelent meg. Egy korábbi körben Grok 4.7 és MiMo v2.6 Flash/Pro érkezett, majd most Anthropic kiadta Claude Opus 5.5-öt; körülbelül egy órával később pedig OpenAI bemutatta a GPT-6 Sol és GPT-6 Luna modelleket. A részletes teszteléshez idő kell, de a korai tapasztalatokból világos, hogy jelentős árváltozások és viselkedésbeli különbségek látszanak.

Árazási változások — lényeges csökkenések

A legszembeötlőbb változás az árakban van. A GPT-6 Luna és GPT-6 Sol ára lényegesen alacsonyabb a GPT-5.6 megfelelőinél: többek között a GPT-6 Luna inputja most 0,10 USD/millió token, cache input 0,01 USD/millió, output pedig 0,50 USD/millió. Ezzel összehasonlítva a GPT-5.6 Luna árai 0,20/0,02/1,20 USD/millió voltak (input/cached input/output).

A cikkben közölt további példák a következők:

  • Grok 4.7: 2 USD/millió input, 0,50 USD/millió cached input, 6 USD/millió output
  • GPT-6 Sol: 2 / 0,20 / 10 USD/millió
  • GPT-5.6 Terra: 2 / 0,20 / 12 USD/millió
  • Claude Opus 5.5: 4 / 0,20 / 20 USD/millió
  • GPT-5.6 Sol: 4 / 0,40 / 20 USD/millió
  • Claude Fable 5.1: 10 / 0,25 / 50 USD/millió
  • GPT-6 Astra: 10 / 1 / 50 USD/millió

Fontos kontextus, hogy GPT-5.6 modellekhez volt ütemezve 25%-os áremelés novemberre, így a GPT-6 modellek ára valójában a promócionális 5.6-hoz képest is kedvezőbbnek tűnik. A GPT-5.6 Terra ára és a GPT-6 Sol ára azonos szinten volt, így a GPT-6 bevezetése megszüntette a Terra használatának akármilyen ár-alapú indokát.

A GPT-6 Luna árszintje (0,10/0,50) az OpenAI történetében az egyik legalacsonyabb, csak néhány gyengébb, korábbi Nano-osztályú modell ára volt ennél alacsonyabb.

Anthropic: Opus 5.5 és árcsökkentés

Anthropic szerint Opus 5.5 azokra a visszajelzésekre épül, amelyek az Opus kommunikációs stílusát kritizálták. Thariq Shihipar megjegyzése alapján Opus 5.5 egyértelműbben kommunikál, token-hatékonysága jobb, és az intelligenciáját tekintve a Fable 5.1-re emlékeztet. Emellett állítólag jobban teljesít a „Blender” jellegű feladatoknál.

Árban az Opus család eddigi tagjai (4.5–5) 5 USD/millió input és 25 USD/millió output áron voltak. Opus 5.5 ezeket 20%-kal csökkentve 4 USD/millió inputra és 20 USD/millió outputra hozta le. A cache read (cache-ból olvasott input) ára még jelentősebb mértékben esett (60%), ami hosszabb, ügynök-szerű beszélgetéseknél nagy hatással lehet, mivel ezeknél gyakran a bemeneti tokenek többsége cache-ként kerül feldolgozásra.

A mostani árszintek alapján Opus 5.5 ára megegyezett a GPT-5.6 Sol korábbi árával — azonban ez az egyensúly felborult, miután OpenAI a Sol modellek árát tovább csökkentette.

Anthropic jelezte, hogy Sonnet 5.5 és Haiku 5.5 is érkezik hamarosan; kérdéses, hogy a Haiku visszanyerheti-e árversenyképességét az alsó kategóriában, tekintve hogy jelenleg Haiku 4.5 ára 1/5 USD/millió, míg az új GPT-6 Luna 0,10/0,50 USD/millió.

Teljesítési tapasztalatok: Opus 5.5 túl sokat „gondolkodott” egy SVG-példán

A gyakorlatban Opus 5.5-nél előjött egy működésbeli probléma: egy egyszerű feladatra — "Generate an SVG of a pelican riding a bicycle" — a Claude Opus 5.5 "max" gondolkodási szinten nem adott választ. A modell részletes, iteratív belső tervezésbe kezdett, erősen részletező és számszerűsítő belső taxonómiákat és geometriát írva (például sípcsont hosszát, lábmozgást, pedálhoz illeszkedés koordinátáit, réteg-rendeket, viewBox méretezést stb.), majd elérte a modell 128 000 maximális kimeneti token korlátját miközben még mindig a készítés közben volt.

A tesztismétlés ugyanilyen eredményre vezetett: a "max" beállításnál a túlzott belső reasoning végül megszakította a választ. Két ilyen kudarc körülbelül 2,56 USD-be került összesen, és mindkettő közel 20 percig tartott. Ez arra enged következtetni, hogy a "max" szint túl sok belső számítást végezhet, ami egyes egyszerű feladatoknál kontraproduktív lehet.

Ezzel szemben Claude Fable 5.1 "max" beállításon nem akadt el, és a cikkíró szerint az Fable 5.1 hozta a legjobb pelican-ábrát az Anthropic-modellek közül.

Vizualizációk és összehasonlítások

A szerző külön SVG-pelicanokat renderelt GPT-6 Luna és GPT-6 Sol alatt, valamint Opus 5.5, Opus 5, Fable 5.1 és Sonnet 5 pelicanokkal készített összehasonlító rácsot. Szemrevételezés alapján a 5.6 család élénkebb, merészebb színeket használt, míg a 6-os család mutatósan visszafogottabb tónusokat alkalmazott; a szerző személyes preferenciája szerint a GPT-6 Astra maximális beállításon adta a legjobb pelicant.

Gyakorlati használat

A szerző mostantól alapértelmezettként a GPT-6 Sol-t és a Claude Opus 5.5-öt használja a Codex és Claude Code munkafolyamataihoz. A Datasette Agent demóját (agent.datasette.io) frissítette GPT-6 Luna használatára; a tesztek alapján a Luna gyors és kompetens SQL-lekérdezésekben, valamint HTML és JavaScript generálásban a Datasette Apps-hez.

Összegzés

A gyors árcsökkentések és az új modellek megjelenése jelentős piaci mozgást okoz: az alsó és középszintű modellek ára különösen lejjebb ment, ami gyorsan módosítja a korábbi választási szempontokat. Ugyanakkor a teljesítmény oldalán is látszanak különbségek: Opus 5.5 javított kommunikációban és token-hatékonyságban, de a "max" reasoning mód túlzott belső gondolkodása problémás lehet bizonyos feladatoknál. A verseny folytatódik, Anthropic további 5.5-ös kiadásokra készül, és a felhasználók hamarosan több adat alapján hozhatnak döntést arról, mely modellek érdemesek a mindennapi alkalmazásokhoz.