Anthropic egyik fellows programjában dolgozó kutató bemutatott egy kísérleti rendszert, amely automatizált módon képes javítani egy mesterséges intelligencia modell viselkedését meghatározott "alignment" (összehangoltsági) benchmarkokon. A kutatócsoport pénteken tette közzé a „Automated Researchers Can Reliably Mitigate Alignment Failures” című tanulmányt, amelyben azt állítják, hogy az automatizált megközelítés minden, a vizsgálatba bevont tíz speciális rosszul összehangolt viselkedésre hatékony javulást eredményezett anélkül, hogy az általános teljesítmény romlott volna.
A rendszer működése
A tanulmányban bemutatott Automated Alignment Researcher (AAR) több hagyományos kutatási lépést automatikusan ismétel meg:
- átnézi a rendelkezésre álló irodalmat,
- javaslatot tesz egy módszerre,
- ezt a módszert alkalmazva 30 percig tréningezi a modellt,
- több iteráción keresztül fokozatosan növeli a benchmarkokon elért szintet.
A rendszer megtartja a hatékony módszereket és elveti a kevésbé hatásosakat, ami lehetővé teszi a gyors és skálázható működést.
Eredmények és összehasonlítás emberekkel
A tanulmány szerzői szerint az automatizált megoldás minden vizsgált benchmarkon javította a modells viselkedését, és nem rontotta az összteljesítményt. A papír kifejezetten összehasonlította az AAR-t emberi kutatókkal: „A legjobb AAR-módszer átlagosan hat órán belül legyőzi azt, amit tapasztalt emberek javasolnak” — olvasható a közleményben. A szerzők azt is megjegyzik, hogy „az ember által irányított kutatási irányok nem vezetnek erősebb teljesítményhez.”
A költségoldalt is számszerűsítették: az AAR API-alapú inferencia költsége nagyjából 4 dollár/óra, míg az emberi kutatókat a tanulmány szerzői szerint 150 dollár/óra díjazás mellett alkalmazzák.
Miért fontos ez?
A munka egy lépés a rekurszív önfejlesztés (recursive self‑improvement) felé, amelyet sokan a mesterséges intelligencia következő jelentős mérföldkövének tartanak. Ha a modellek képesek saját összehangolásukat javítani, elképzelhető, hogy később általánosabban is képesek lesznek továbbfejleszteni a tréningeljárásokat — ami végső soron csökkentheti az emberi kutatók szerepét.
Korlátok és további teendők
A szerzők a tanulmányban több fontos korlátot is megemlítenek:
- Az automatizált rendszer csak annyira hatékony, amennyire a benchmarkok valóban tükrözik a kívánt összehangolási célokat.
- Jelentős munka szükséges a benchmarkok létrehozásához, karbantartásához és frissítéséhez.
- Az automatizált kutatók a rendelkezésre álló szakirodalomra támaszkodnak, így az irodalom fenntartása és bővítése is kritikus feladat.
A tanulmány a szerzők szerint korai bizonyítékot nyújt arra, hogy az automatizált utólagos összehangolás (automated alignment post-training) a közeljövőben gyakorlatias lehet, de a módszer széleskörű alkalmazása további kutatást és infrastruktúrát igényel.
Következtetések
Az Anthropic kutatócsoportjának eredményei ígéretesek: egy automatizált rendszer képes rövid idő alatt javítani modellek viselkedését specifikus összehangolási benchmarkokon, költséghatékonyabban, mint a hagyományos emberi kutatás. Ugyanakkor a szerzők nyíltan kezelik a módszer korlátait, és hangsúlyozzák, hogy a benchmarkok és a szakirodalom minőségének fenntartása döntő lesz a jövőbeni alkalmazhatóság szempontjából.



