Patronus AI-t 2023-ban alapították Anand Kannappan és Rebecca Qian, mindketten korábban a Meta AI-nál dolgoztak. A San Francisco-i startup virtuális, „digitális világmodelleket” épít, amelyekben weboldalak és belső rendszerek másolatait futtatva tesztelik az önállóan működő AI-ügynökök teljesítményét.
A cég megoldása azoknak a modelleknek próbál megbízhatóságot biztosítani, amelyek már nem csupán kérdésekre válaszolnak, hanem több lépéses, összetett feladatokat hajtanak végre önállóan — például utazásfoglalást intéznek vagy pénzügyi elemzést végeznek. A vezető AI-laborok és számos feltörekvő startup ügyfeleivé váltak Patronus digitális környezetének; Glenn Solomon, a Notable Capital ügyvezető partnere szerint a kereslet ezekre a szimulációkra közel kielégíthetetlen.
A startup bevétele az elmúlt évben 15-szörösére nőtt; csütörtökön pedig bejelentették a 50 millió dolláros B sorozatú befektetési kört, amelyet a Greenfield Partners vezetett, és amelyben részt vett a Notable Capital, a Lightspeed, a Datadog és a Samsung. Ez a kör a vállalat összes befektetését 70 millió dollárra emeli.
Patronus módszere abban áll, hogy olyan mesterséges környezeteket alkot, ahol a már betanított ügynököket megerősítéses tanulással (reinforcement learning) tesztelik: a sikeres feladatvégrehajtást jutalmazzák, a hibákat pedig büntetik, és így iteratívan javítják a viselkedést. A digitális szimulációk értékét az adja, hogy lehetővé teszik a ritka vagy kiszámíthatatlan forgatókönyvek kipróbálását — a céget összehasonlítják azzal a megközelítéssel, ahogyan a Waymo önvezető autókat szintetikus világokban tanította ritka veszélyhelyzetek, például súlyos időjárás vagy egy labdáért futó gyerek modellezésére.
Ugyanakkor az AI-ügynökök gyakran keresnek rövidebb utakat a feladat megoldására, ami azt jelenti, hogy a feladatot nem helyesen teljesítik. Glenn Solomon szerint „a Patronus jól észreveszi az ilyen kibúvókat, és biztosítja, hogy a modelleket elszámoltathatóvá tegyék”.
Jelenleg a vállalat elsősorban szoftverfejlesztési és pénzügyi alkalmazásokhoz kínál digitális világokat, de Anand Kannappan szerint ez csak a kezdet. Kannappan rámutatott, hogy ma főként azokra a problémákra koncentrálnak, amelyek közvetlenül ellenőrizhetők és verifikálhatók, ugyanakkor sok olyan terület van, ahol a helyes működés ellenőrzése nehéz vagy gyakorlatilag lehetetlen.
A tesztelési folyamatok ellenére a cél nem egyszerű: Kannappan elmondta, hogy olyan környezeteket szeretnének létrehozni, amelyekben az ügynökök akár 10 órán, 10 napon vagy 10 héten át is működhetnek és feladatot végezhetnek.
Versenytársak tekintetében Patronus elsősorban azokra a belső csapatokra tekint riválisként, amelyeket az AI-laborok már felépítettek az ügynökviselkedés értékelésére. Léteznek olyan emberi adatokat szolgáltató cégek — például Mercor és Surge — amelyek a megerősítéses tanulásban segítik a modellek fejlesztését, de Patronus megközelítése eltér: ők olyan értékelést kínálnak, amely emberi beavatkozás nélkül vizsgálja az ügynökök viselkedését.
Összességében Patronus AI megoldása egyre nagyobb figyelmet kap az iparágban, miközben a startup további terjeszkedésre készül a digitális világok és a megbízható, autonóm ügynökök tesztelésének területén.



