Kutatás

Mesterséges intelligenciával generált szöveg

Autonóm AI-k kimerítő tesztje: a gépek 82%-ig közelítik a kutatói rutint, de új ötletet nem szülnek

A Prime Intellect jelentette be eddigi legnagyobb autonóm MI-kísérletét, amelyben 18 fejlett modell nyolc napon át elszigetelt, offline homokozókban 153 teljesen autonóm kutatási kísérletet futtatott a nanoGPT optimalizátor speedrun kihíváson.

Autonóm AI-k kimerítő tesztje: a gépek 82%-ig közelítik a kutatói rutint, de új ötletet nem szülnek

A Prime Intellect bejelentette eddigi legnagyobb autonóm AI-kísérletét: 18 élvonalbeli modellt zártak nyolc napra elszigetelt, offline homokozókba, ahol összesen 153 teljesen autonóm kutatási kísérletet futtattak. A vizsgálat a nanoGPT optimizer „speedrun” kihívására irányult, amelyben az a cél, hogy adott validációs veszteséget a lehető legkevesebb tanulási lépés alatt érjenek el.

Mi történt pontosan

  • A kísérletben részt vevő modellek nyolc napon át, emberi beavatkozás nélkül hajtottak végre kísérleteket egy elszigetelt környezetben.
  • Összesen 153 teljesen autonóm kísérlet zajlott le a nanoGPT optimalizáló sebességversenyén.
  • Emberi mérnökök rekordértéke a kihívásban 2 600 lépés, amelyhez hónapok munkája és ismételt finomhangolás vezetett.
  • A modellek teljesítménye különböző volt: a Fable 5 a legjobb volt, és a kísérlet szerzői szerint a teljes különbség 82%-át „zárta le” a 2 726 lépéses eredmény felé; az Opus 5 54%-ot ért el, míg a GPT-5.5 csak 8%-ot.
  • Egyetlen modell sem talált fel vagy használt olyan módszert, amely ne lett volna korábban a megjelent szakirodalomban.

Mit jelent ez a gyakorlatban

A kísérlet közvetlenül vizsgálta azt az állítást, amelyet Jack Clark, az Anthropic társalapítója tett májusban: a „zseni” egy százalék ihlet és kilencvenkilenc százalék verejték, és ha az AI képes „megenni” ezt a verejtéket, akkor önmagától javulhat 2028-ig. A Prime Intellect vizsgálata szerint a ritkábban magasztalt, de időigényes és monoton kísérleti munka — a kilencvenkilenc százalék — tekintetében a legjobb modell a humán rekord 82%-át tudta reprodukálni. Az egy százaléknyi kreatív ugrás tekintetében azonban a modellek nullát értek: nem fedeztek fel egyetlen, publikált irodalmon túlmutató új módszert sem.

Következtetések

  • Az eredmények azt mutatják, hogy a jelenlegi autonóm rendszerek rendkívül kitartó, gépies „kutatási asszisztensekké” válhatnak, amelyek nagy részben képesek elvégezni a kísérletek futtatásához és ismétléséhez kapcsolódó munkát.
  • Ugyanakkor ezek a rendszerek még nem váltak független kutatóvá: a kreatív ötlet, amely áttörést hoz, továbbra is emberi szerepet igényel.

A Prime Intellect kísérlete fontos mérföldkő abban, hogy megértsük, milyen munkát lehet automatizálni a kutatásban és hol marad szükség kreatív emberi gondolkodásra.