Kutatás

Mesterséges intelligenciával generált szöveg

Anthropic automatizált kutatója bemutatta az önfejlesztő AI irányába mutató kísérleti rendszert

A főszereplő az Anthropic vállalat és a vállalat fellows programjában dolgozó kutató, Chen Yueh-Han, akik egy új tanulmányban mutatták be az Automated Alignment Researcher (AAR) nevű rendszert.

Anthropic automatizált kutatója bemutatta az önfejlesztő AI irányába mutató kísérleti rendszert

Anthropic egyik fellows programjában dolgozó kutató bemutatott egy kísérleti rendszert, amely automatizált módon képes javítani egy mesterséges intelligencia modell viselkedését meghatározott "alignment" (összehangoltsági) benchmarkokon. A kutatócsoport pénteken tette közzé a „Automated Researchers Can Reliably Mitigate Alignment Failures” című tanulmányt, amelyben azt állítják, hogy az automatizált megközelítés minden, a vizsgálatba bevont tíz speciális rosszul összehangolt viselkedésre hatékony javulást eredményezett anélkül, hogy az általános teljesítmény romlott volna.

A rendszer működése

A tanulmányban bemutatott Automated Alignment Researcher (AAR) több hagyományos kutatási lépést automatikusan ismétel meg:

  • átnézi a rendelkezésre álló irodalmat,
  • javaslatot tesz egy módszerre,
  • ezt a módszert alkalmazva 30 percig tréningezi a modellt,
  • több iteráción keresztül fokozatosan növeli a benchmarkokon elért szintet.

A rendszer megtartja a hatékony módszereket és elveti a kevésbé hatásosakat, ami lehetővé teszi a gyors és skálázható működést.

Eredmények és összehasonlítás emberekkel

A tanulmány szerzői szerint az automatizált megoldás minden vizsgált benchmarkon javította a modells viselkedését, és nem rontotta az összteljesítményt. A papír kifejezetten összehasonlította az AAR-t emberi kutatókkal: „A legjobb AAR-módszer átlagosan hat órán belül legyőzi azt, amit tapasztalt emberek javasolnak” — olvasható a közleményben. A szerzők azt is megjegyzik, hogy „az ember által irányított kutatási irányok nem vezetnek erősebb teljesítményhez.”

A költségoldalt is számszerűsítették: az AAR API-alapú inferencia költsége nagyjából 4 dollár/óra, míg az emberi kutatókat a tanulmány szerzői szerint 150 dollár/óra díjazás mellett alkalmazzák.

Miért fontos ez?

A munka egy lépés a rekurszív önfejlesztés (recursive self‑improvement) felé, amelyet sokan a mesterséges intelligencia következő jelentős mérföldkövének tartanak. Ha a modellek képesek saját összehangolásukat javítani, elképzelhető, hogy később általánosabban is képesek lesznek továbbfejleszteni a tréningeljárásokat — ami végső soron csökkentheti az emberi kutatók szerepét.

Korlátok és további teendők

A szerzők a tanulmányban több fontos korlátot is megemlítenek:

  • Az automatizált rendszer csak annyira hatékony, amennyire a benchmarkok valóban tükrözik a kívánt összehangolási célokat.
  • Jelentős munka szükséges a benchmarkok létrehozásához, karbantartásához és frissítéséhez.
  • Az automatizált kutatók a rendelkezésre álló szakirodalomra támaszkodnak, így az irodalom fenntartása és bővítése is kritikus feladat.

A tanulmány a szerzők szerint korai bizonyítékot nyújt arra, hogy az automatizált utólagos összehangolás (automated alignment post-training) a közeljövőben gyakorlatias lehet, de a módszer széleskörű alkalmazása további kutatást és infrastruktúrát igényel.

Következtetések

Az Anthropic kutatócsoportjának eredményei ígéretesek: egy automatizált rendszer képes rövid idő alatt javítani modellek viselkedését specifikus összehangolási benchmarkokon, költséghatékonyabban, mint a hagyományos emberi kutatás. Ugyanakkor a szerzők nyíltan kezelik a módszer korlátait, és hangsúlyozzák, hogy a benchmarkok és a szakirodalom minőségének fenntartása döntő lesz a jövőbeni alkalmazhatóság szempontjából.