A modern, nagytételű vizsgálatok megbízhatóságának egyik fő problémája a benchmarkszennyezés: ha a vizsgálat kérdései vagy promptjai előbb eljutnak a modellekhez, az eredmények torzulnak, és nem tükrözik a tényleges képességeket. Ennek elkerülésére Google és több partner bejelentettek egy pilotot, amelyet szerintük a világ első kettős vak (double-blind) külső értékelésének tekintenek egy zárt forráskódú, élvonalbeli AI modell esetében — a tesztalany a Gemini Flash Lite modell.
Kik vesznek részt
A projektben résztvevő külső partnerek: Singapore AI Safety Institute, OpenMined, AVERI és MLCommons. Google úgy írja le az új eljárást, hogy a modell- és értékelődati titoktartás technikai, kriptográfiai biztosításával kívánják növelni az értékelések integritását.
Mit csinálnak másként
A hagyományos megközelítésnél külső értékelők vagy átadták a teszt-promptokat a modellszolgáltatónak (kockáztatva a benchmarkszennyezést), vagy a szolgáltató adta át a modell súlyait (kockáztatva a szellemi tulajdont). A kettős vak elrendezés ezt a kompromisszumot iktatja ki: a külső értékelési adatok és a proprietáris modell egyaránt a Google Cloud Confidential Computing portfóliójának Confidential Space nevű környezetébe kerülnek, ahol kriptografikus módszerekkel igazolják, hogy a tesztadatok és a modell súlyai csak a tulajdonosaik számára maradnak titkosak.
A megvalósítás lényege, hogy az értékelő nem fér hozzá a Gemini modell súlyaihoz, és egyidejűleg a Google sem látja az értékelők tesztpromptjait. Google hangsúlyozza, hogy a technikai és kriptográfiai védelmi rétegek további lépést jelentenek a korábbi, jogi és eljárási alapú titoktartási megoldásokhoz képest.
Miért számít ez
A módszer csökkenti a benchmarkszennyezés kockázatát és védelmet nyújt érzékeny értékelési anyagok számára — különösen olyan vizsgálatoknál lehet fontos, amelyek például kiberbiztonsági vagy kormányzati alkalmazások biztonságát méretnék. A kriptográfiai bizonyítékok lehetővé teszik, hogy független szervezetek alapos és biztonságos teszteket hajtsanak végre anélkül, hogy veszélyeztetnék az adatok szuverenitását vagy a modellvédelmet.
Cél és további lépések
Google közleménye szerint a pilot reményeik szerint új mércét állíthat a modellfelügyelet és a külső értékelések gyakorlatában, elősegítve a biztonságosabb, megbízhatóbb és szélesebb körben elfogadott AI rendszerek kialakulását. A dokumentumok és a módszertan részletei műszaki jelentés formájában érhetők el a Google által közzétett anyagban.



