Modellbevezetés

Meta bemutatta a Muse Spark 1.1 multimodális, ügynöki feladatokra optimalizált modelljét

A Meta Superintelligence Labs bemutatta a Muse Spark 1.1 modellt, amely jelentős továbbfejlesztés a korábbi Muse Sparkhoz képest.

Meta bemutatta a Muse Spark 1.1 multimodális, ügynöki feladatokra optimalizált modelljét

A Meta Superintelligence Labs ma bemutatta a Muse Spark 1.1-et, a Muse Spark utódját: multimodális, ügynöki (agentic) feladatokra optimalizált nyelvi és érvelő modell, amelyet elsősorban több alkalmazáson és szolgáltatáson átívelő tervezési és végrehajtási munkákhoz fejlesztettek.

A modell elérhetősége és integráció

  • Muse Spark 1.1 mostantól elérhető „Thinking” módban a Meta AI alkalmazásban és a meta.ai weboldalon.
  • Egyidejűleg a Meta új Meta Model API-ja nyilvános preview-ban indult, amelyen keresztül a fejlesztők hozzáférhetnek Muse Spark 1.1-hez.
  • A bejelentés a Muse Image ezen a héten történt indulását kíséri, amelyek együtt közelebb viszik a célt "személyes superintelligencia" szolgáltatások irányába.

Miben jobb a Muse Spark 1.1

  • Ügynöki munkák: a modell jelentősen javítja az olyan személyes, célorientált feladatokat, amelyek több külső alkalmazás és szolgáltatás összehangolását igénylik. Képes zéró-shot módon általánosítani új natív eszközökre, MCP szerverekre és egyedi készségekre.
  • Többszörös ügynök-orchesztráció: a Muse Spark 1.1-t úgy képezték, hogy több ügynök közti munkamegosztást optimalizáljon az end-to-end késleltetés csökkentése érdekében. Főügynökként kontextust gyűjt, tervet készít és párhuzamos alügynökökre osztja a végrehajtást; alügynökként pedig tartja a szerepét, ismeri a rendelkezésre álló eszközöket és tudja, mikor kell visszaadni a kontrollt a főügynöknek.
  • Hosszú kontextus: a modell aktívan kezeli a 1 millió tokenes kontextusablakot; emlékszik korábbi műveletekre, előhív információkat korábbi munkákból és a fontos lépéseket tömörítve tartja meg későbbi használatra.
  • Számítógép-használat és munkafolyamatok: hatékonyan dolgozik több alkalmazást átfogó, folyamatosan változó információval működő munkafolyamatokon, fenntartva a kontextust hosszú munkameneteken át, alkalmazkodva a változó követelményekhez és minimális emberi beavatkozással navigálva ismeretlen felületeken.

Automatizáció és interfész-használat

A modell nem követ minden egyes asztali lépést kattintásról kattintásra, hanem képes eldönteni, mikor érdemes automatizálni (például scriptet írni) és mikor egyszerűbb a közvetlen interakció. A képzés során hangsúlyozták, hogy a modell tudjon scripteket írni, közvetlen kattintásokat végrehajtani, és lépésenként tömeges műveleteket generálni.

Gyakorlati példák

  • Ügynöki vacsoraszervezés: a modell felismeri a feladat közben felmerülő új kontextust (például változó igényeket), és szükség szerint frissíti a rendelést felhasználói beavatkozás nélkül.
  • Facebook Marketplace ügynök: egy okostelefóval rögzített videóból a modell kiválaszt hasznos fotókat, termékről érveket állapít meg, és a felhasználó nevében böngészőt vezérelve közzétesz egy Marketplace-hirdetést.

Fejlesztés és hibajavítás (kódolás)

  • Kódolási teljesítmény: Muse Spark 1.1 jelentősen jobb a valós, nagy és összetett kódbázisokkal végzett feladatokban: bonyolult hibák diagnosztizálása és javítása, új funkciók implementálása vállalati rendszerekben, nagyméretű kódmigrációk végrehajtása.
  • Összetett demo: OpenCode-ban bemutatott hibakeresési demó során a modell felépít egy chat webalkalmazást, automatikus képernyőképeket készít a felhasználói hibák azonosításához, visszaköveti a releváns kódrészeket, javítja azokat és validálja a változtatásokat.
  • Agentic coding támogatás: a modell jól működik népszerű ügynöki kódolási környezetekben, támogatva olyan funkciókat, mint a tervezési mód, célfeltételzés, alügynök-delegálás és kontextus-tömörítés.

Multimodális képességek

  • Percepció és multimodális érvelés: a modell erős vizuális- és audiális elemzésben, részletes képi és videóleírásokban, valamint vizuális inputból kódelt kimenetek generálásában.
  • Hosszú munkafolyamatokban megőrzi a vizuális és audio részleteket, és ezeket használja fel számítógépes műveletek végrehajtásához a felhasználó helyett.

Értékelések és használat

  • Belső használat: Meta mérnökei és kutatói naponta használják Muse Spark 1.1-et, amely a Meta Internal Coding Bench belső kódolási értékelésén jelentős javulást mutat a korábbi modellhez képest, és versenyképes a vezető alternatívákkal.
  • Automatizálás kutatásban: kutatók modellfejlesztési és értékelési feladatok automatizálására is alkalmazzák.
  • DeepSWE / OpenCode: Muse Spark 1.1 önértékelést futtatott a DeepSWE részfeladatain, és elemzési műszerfalat generált az eredményekből.

Biztonság és kockázatkezelés

  • Előzetes biztonsági vizsgálatok: a bevezetés előtt széleskörű biztonsági értékeléseket végeztek a Meta Advanced AI Scaling Framework-je szerint, amely meghatározza az értékeléseket, fenyegetési modelleket és a bevezetési küszöböket a legfejlettebb modellekre.
  • Frontvonalbeli kockázatok: a vizsgálatok szerint Muse Spark 1.1 a Chemcial & Biological, Cybersecurity és Loss of Control kategóriákban a biztonságos határokon belül működik.
  • Ellenállás: a modell jó ellenállást mutat közvetlen jailbreak-támadásokkal, megbízhatatlan adatokból származó indirekt támadásokkal, prompt injectionnel és fejlesztői prompt-támadásokkal szemben; alacsonyabb hallucinációs arányt és csökkentett szolgalelkűséget (sycophancy) mutat.
  • Részletes biztonsági helyzet: a Muse Spark 1.1 biztonsági értékelései részletesen megtalálhatók a Muse Spark 1.1 Evaluation Reportban.

Partnerek visszajelzései és betekintés

Korai partnerek úgy jellemzik a modellt, mint „komplett ügynöki alapot”, amely a hosszú kontextuskezelést erős kódolási és érvelési képességekkel párosítja, és alkalmas nagy méretű ügynöki terhelések kezelésére. Yashodha Bhavnani, a Box VP of AI Products, azt emelte ki, hogy Muse Spark versenyképes vállalati képességeket nyújt és erős a strukturált, procedurális munkafolyamatok kezelésében különböző iparágakban.

Kitekintés

A Meta hangsúlyozza, hogy a Muse Spark 1.1 a kutatási előrehaladásuk egyik mérföldköve, és további, még képességesebb modelleken dolgoznak. A mostani kiadás lehetővé teszi, hogy fejlesztők és vállalatok elkezdjenek építeni az új Meta Model API-n keresztül, miközben a cég folytatja az értékeléseket és a fejlesztést.


[Fontos név- és fogalomismertetés: Muse Spark 1.1 — Meta Superintelligence Labs által fejlesztett multimodális, ügynöki feladatokra optimalizált modell; Meta Model API — a Meta új modell-hozzáférési felülete nyilvános preview státuszban; Advanced AI Scaling Framework — Meta biztonsági és értékelési keretrendszere.]