Modellbevezetés

Sakana AI Fugu és Fugu-Ultra: modellek orkestrálása több modell feladatainak elvégzésére

A tokiói Sakana AI bemutatta a Fugu és Fugu-Ultra modelleket, amelyek más nyelvi modelleket és ügynököket hívnak meg egyetlen API-n keresztül, hogy egymást kiegészítve oldjanak meg feladatokat.

Sakana AI Fugu és Fugu-Ultra: modellek orkestrálása több modell feladatainak elvégzésére

A tokiói Sakana AI két új modellt publikált, amelyek nem maguk próbálnak minden feladatot megoldani, hanem más nagy nyelvi modelleket (LLM-eket) és ügynököket hívnak meg feladatdelegálásra egyetlen API-n keresztül. A Fugu a gyors, diszkrét feladatokra — például alapvető kódolásra és csevegésre — lett optimalizálva, míg a Fugu‑Ultra hosszabb, többlépcsős munkafolyamatok, például terjedelmes kódolás és kutatás kezelésére szolgál.

Mire képesek és hogyan működnek

Mindkét rendszer bemeneti képeket és szöveget fogad, és szöveges választ ad. Kompatibilisek többek között OpenAI Codex-szel, lehetőség van alapszintű modellek kiválasztására, eszközhasználatra, és magas illetve extra magas szintű érvelési módok beállítására. A Fugu dönt lépésről lépésre, hogy az adott feladathoz melyik munkavégző modellt hívja meg, míg a Fugu‑Ultra a bemenetet részekre bontja, alkérdésekre szab agentikus munkafolyamatokat, és az egyes alkérdéseknél — akár párhuzamosan — hív modelleket. A Fugu‑Ultra képes önmagát is meghívni, ezáltal rekurzívan tovább bontani a feladatot.

A rendszerek széles körű LLM‑eket képesek hívni: Sakana szerint ez magában foglal titkosított nyílt modelleket és zárt modelleket is Anthropictól, Google‑tól és OpenAI‑tól, köztük a Claude Opus 4.8-at, Gemini 3.1 Pro‑t és GPT‑5.5‑öt, valamint Fugu vagy Fugu‑Ultra példányokat.

Képzés és tanítási eljárások

Sakana azt írja, hogy a Fugu család egy, az ügynökszerű munkavégzést megtanuló alapmodellt finomhangolásával készült. A finomhangolás céljai között szerepelt a kódolás, matematika, nyelvi megértés, többlépcsős érvelés és eszközhasználat. A munkavégző modelleket többször is megfuttatták minden feladaton, majd a kimeneteket sikeresség szerint pontozva tanították a Fugu modelleket úgy, hogy azok kövessék a munkavégzők teljesítmény‑eloszlását.

A felügyelt finomhangolást követően Sakana egy szeparált evolúciós algoritmust (sep‑CMA‑ES) alkalmazott arra, hogy a Fugu modellek megtanulják kiválasztani a legalkalmasabb modellt különböző agentikus feladatokhoz és keretrendszerekhez (például Claude Code, Codex, OpenCode). A Fugu‑Ultra esetében a Conductor nevű koordinációs modell bontja alkérdésekre a feladatot és irányítja a függetlenül működő ügynököket; az ügynökök saját eszközhasználatot folytathatnak és megoszthatnak memóriát egymással.

Ezen felül a Fugu‑Ultra tanítása során Sakana megerősítéses tanulási eljárást (GRPO) alkalmazott, hogy az alapmodell megtanulja a többlépéses, agentikus munkafolyamatok promptolását és kiterjesztését. A siker kritériuma az volt, hogy a munkafolyamatok megoldásai egyezzenek egy emberi megoldással.

Teljesítmény és benchmarkok

A Sakana által közölt eredmények szerint mindkét rendszer több benchmarkon érte el a legjobb elérhető teljesítményt az elérhető modellekkel összevetve, és bizonyos feladatkategóriákban a kereskedelmi forgalomban jelenleg elérhető legjobb modellekkel vetekednek:

  • Terminal Bench 2.1, GPQA‑Diamond és LiveCodeBench: mindkét modell jobb teljesítményt mutatott, mint Claude Fable 5, Claude Mythos Preview és GPT‑5.5.
  • CharXiv Reasoning és CTI‑Realm: Fugu‑Ultra felülmúlta Claude Fable 5‑öt, Claude Mythos Preview‑t és GPT‑5.5‑öt.
  • SWE‑Bench Pro, Humanity’s Last Exam és LiveCodeBench Pro: Fugu‑Ultra itt minden elérhető modellnél jobb eredményt ért el.
  • GPQA‑Diamondon (graduate‑szintű tudományos ismeretek): mindkét modell 95.5%-ot ért el, a megadott legjobb érték.
  • SciCode (valós tudományos problémák kódolása): Fugu 60.1‑gyel a legjobb az elérhető modellek között, csak Claude Fable 5 előzi meg.
  • Hosszú kontextusú érvelésben (AA‑LCR): Fugu állította fel az állami-of-the‑artot; a hosszú kontextusú visszaidézés tesztjén (MCRv2) mindkét modell mögött csak a GPT‑5.5 állt.

A Sakana csapata megjegyzi, hogy bizonyos kategóriákban, különösen olyan modellekkel szemben, amelyek jelenleg nincsenek széles körben kereskedelmi forgalomban, a Fugu modellek kicsit lemaradnak, ugyanakkor különösen erősnek bizonyultak hosszú kontextusú problémák és szoftvermérnöki feladatok kezelésében.

Elérhetőség és árképzés

A modellek Európán kívül elérhetők a Sakana API‑n, valamint olyan szolgáltatókon keresztül, mint az OpenRouter és a Vercel. A Fugu ára megegyezik a legfelsőbb szintű alapszolgáltatásként használt modell normál díjszabásával. A Fugu‑Ultra esetében a token‑árak: 5/30/0.50 USD per 1 millió bemeneti/kimeneti/cached token (az összeg kétszerese érvényes 272,000 token feletti kontextusoknál). Emellett előfizetéses csomagok érhetők el: standard/pro/max havi 20/100/200 USD, ahol a pro és max csomagok rendre 10× és 30×‑os használati limiteket biztosítanak a standardhoz képest.

Mit nem árultak el

Sakana nem tette közzé az orchestration recepteket, a használt adatkészletek részleteit, az architektúrák specifikációit vagy a modellek paraméterszámait.

Miért fontos ez

Az ilyen modellek segítenek csökkenteni a függőséget egyetlen nagy szolgáltatótól vagy országtól, mivel az orchestratorok egy tetszőleges modellkészletet hívhatnak meg: a fejlesztők ki‑ és bekapcsolhatnak szolgáltatókat az érzékenység, költség vagy működési igények alapján. Az Egyesült Államok kormányának egyes korlátozó lépései és Anthropic bizonyos hozzáférési‑ és adatmegőrzési feltételei miatt megnőtt az érdeklődés az ilyen többforrású megoldások iránt.

Háttér és kilátások

Korábban Sakana más technikákat is vizsgált a modellek összevonására, például model merging megközelítéseket, de az agentikus orchestration eddig a legsikeresebb útjuknak tűnik. Hasonló irányvonalat követ az OpenRouter Fusion bemutatása is, amely azt mutatta meg, hogy több modell kombinációja felülmúlhatja az egyedül működő modelleket, és költséghatékonyabb közelítést tehet lehetővé.

Az orchestrációs modellek a magasabb absztrakciós szintre emelik az ügynök‑technikákat: nem csak eszközöket és alügynököket váltanak, hanem maguk a modellek is dinamiku san cserélődhetnek a munkafolyamat során. Ez új konkurenciát teremt az API‑szolgáltatók között, mert a fejlesztők most már maguk is kínálhatnak orchestrátorokat, és így más cégek modelljeit integrálhatják saját alkalmazásaikba.