A Meta Superintelligence Labs ma bemutatta a Muse Spark 1.1-et, a Muse Spark utódját: multimodális, ügynöki (agentic) feladatokra optimalizált nyelvi és érvelő modell, amelyet elsősorban több alkalmazáson és szolgáltatáson átívelő tervezési és végrehajtási munkákhoz fejlesztettek.
A modell elérhetősége és integráció
- Muse Spark 1.1 mostantól elérhető „Thinking” módban a Meta AI alkalmazásban és a meta.ai weboldalon.
- Egyidejűleg a Meta új Meta Model API-ja nyilvános preview-ban indult, amelyen keresztül a fejlesztők hozzáférhetnek Muse Spark 1.1-hez.
- A bejelentés a Muse Image ezen a héten történt indulását kíséri, amelyek együtt közelebb viszik a célt "személyes superintelligencia" szolgáltatások irányába.
Miben jobb a Muse Spark 1.1
- Ügynöki munkák: a modell jelentősen javítja az olyan személyes, célorientált feladatokat, amelyek több külső alkalmazás és szolgáltatás összehangolását igénylik. Képes zéró-shot módon általánosítani új natív eszközökre, MCP szerverekre és egyedi készségekre.
- Többszörös ügynök-orchesztráció: a Muse Spark 1.1-t úgy képezték, hogy több ügynök közti munkamegosztást optimalizáljon az end-to-end késleltetés csökkentése érdekében. Főügynökként kontextust gyűjt, tervet készít és párhuzamos alügynökökre osztja a végrehajtást; alügynökként pedig tartja a szerepét, ismeri a rendelkezésre álló eszközöket és tudja, mikor kell visszaadni a kontrollt a főügynöknek.
- Hosszú kontextus: a modell aktívan kezeli a 1 millió tokenes kontextusablakot; emlékszik korábbi műveletekre, előhív információkat korábbi munkákból és a fontos lépéseket tömörítve tartja meg későbbi használatra.
- Számítógép-használat és munkafolyamatok: hatékonyan dolgozik több alkalmazást átfogó, folyamatosan változó információval működő munkafolyamatokon, fenntartva a kontextust hosszú munkameneteken át, alkalmazkodva a változó követelményekhez és minimális emberi beavatkozással navigálva ismeretlen felületeken.
Automatizáció és interfész-használat
A modell nem követ minden egyes asztali lépést kattintásról kattintásra, hanem képes eldönteni, mikor érdemes automatizálni (például scriptet írni) és mikor egyszerűbb a közvetlen interakció. A képzés során hangsúlyozták, hogy a modell tudjon scripteket írni, közvetlen kattintásokat végrehajtani, és lépésenként tömeges műveleteket generálni.
Gyakorlati példák
- Ügynöki vacsoraszervezés: a modell felismeri a feladat közben felmerülő új kontextust (például változó igényeket), és szükség szerint frissíti a rendelést felhasználói beavatkozás nélkül.
- Facebook Marketplace ügynök: egy okostelefóval rögzített videóból a modell kiválaszt hasznos fotókat, termékről érveket állapít meg, és a felhasználó nevében böngészőt vezérelve közzétesz egy Marketplace-hirdetést.
Fejlesztés és hibajavítás (kódolás)
- Kódolási teljesítmény: Muse Spark 1.1 jelentősen jobb a valós, nagy és összetett kódbázisokkal végzett feladatokban: bonyolult hibák diagnosztizálása és javítása, új funkciók implementálása vállalati rendszerekben, nagyméretű kódmigrációk végrehajtása.
- Összetett demo: OpenCode-ban bemutatott hibakeresési demó során a modell felépít egy chat webalkalmazást, automatikus képernyőképeket készít a felhasználói hibák azonosításához, visszaköveti a releváns kódrészeket, javítja azokat és validálja a változtatásokat.
- Agentic coding támogatás: a modell jól működik népszerű ügynöki kódolási környezetekben, támogatva olyan funkciókat, mint a tervezési mód, célfeltételzés, alügynök-delegálás és kontextus-tömörítés.
Multimodális képességek
- Percepció és multimodális érvelés: a modell erős vizuális- és audiális elemzésben, részletes képi és videóleírásokban, valamint vizuális inputból kódelt kimenetek generálásában.
- Hosszú munkafolyamatokban megőrzi a vizuális és audio részleteket, és ezeket használja fel számítógépes műveletek végrehajtásához a felhasználó helyett.
Értékelések és használat
- Belső használat: Meta mérnökei és kutatói naponta használják Muse Spark 1.1-et, amely a Meta Internal Coding Bench belső kódolási értékelésén jelentős javulást mutat a korábbi modellhez képest, és versenyképes a vezető alternatívákkal.
- Automatizálás kutatásban: kutatók modellfejlesztési és értékelési feladatok automatizálására is alkalmazzák.
- DeepSWE / OpenCode: Muse Spark 1.1 önértékelést futtatott a DeepSWE részfeladatain, és elemzési műszerfalat generált az eredményekből.
Biztonság és kockázatkezelés
- Előzetes biztonsági vizsgálatok: a bevezetés előtt széleskörű biztonsági értékeléseket végeztek a Meta Advanced AI Scaling Framework-je szerint, amely meghatározza az értékeléseket, fenyegetési modelleket és a bevezetési küszöböket a legfejlettebb modellekre.
- Frontvonalbeli kockázatok: a vizsgálatok szerint Muse Spark 1.1 a Chemcial & Biological, Cybersecurity és Loss of Control kategóriákban a biztonságos határokon belül működik.
- Ellenállás: a modell jó ellenállást mutat közvetlen jailbreak-támadásokkal, megbízhatatlan adatokból származó indirekt támadásokkal, prompt injectionnel és fejlesztői prompt-támadásokkal szemben; alacsonyabb hallucinációs arányt és csökkentett szolgalelkűséget (sycophancy) mutat.
- Részletes biztonsági helyzet: a Muse Spark 1.1 biztonsági értékelései részletesen megtalálhatók a Muse Spark 1.1 Evaluation Reportban.
Partnerek visszajelzései és betekintés
Korai partnerek úgy jellemzik a modellt, mint „komplett ügynöki alapot”, amely a hosszú kontextuskezelést erős kódolási és érvelési képességekkel párosítja, és alkalmas nagy méretű ügynöki terhelések kezelésére. Yashodha Bhavnani, a Box VP of AI Products, azt emelte ki, hogy Muse Spark versenyképes vállalati képességeket nyújt és erős a strukturált, procedurális munkafolyamatok kezelésében különböző iparágakban.
Kitekintés
A Meta hangsúlyozza, hogy a Muse Spark 1.1 a kutatási előrehaladásuk egyik mérföldköve, és további, még képességesebb modelleken dolgoznak. A mostani kiadás lehetővé teszi, hogy fejlesztők és vállalatok elkezdjenek építeni az új Meta Model API-n keresztül, miközben a cég folytatja az értékeléseket és a fejlesztést.
[Fontos név- és fogalomismertetés: Muse Spark 1.1 — Meta Superintelligence Labs által fejlesztett multimodális, ügynöki feladatokra optimalizált modell; Meta Model API — a Meta új modell-hozzáférési felülete nyilvános preview státuszban; Advanced AI Scaling Framework — Meta biztonsági és értékelési keretrendszere.]



