A Latent Space bejelentette a „Latent Space Frontier AEO tracker” projektet: egy automatizált eszköztárat és elemzést, amely hat promptvariációt futtat hét nagy nyelvi modellen keresztül 161 különböző kategóriában, hogy a modellek ajánlásait összegyűjtse és rangsorolja.
Mi történt és hogyan készült
A csapat többmilliárd tokennyi prototípus-fejlesztés, finomhangolás és skálázási munkafolyamat után állította össze a rendszert. Az ajánlásokból származó válaszok kinyerését Astra végezte, majd egy saját AEO pontszám alapján értékelték az eredményeket. Ez a pontszám súlyozást ad az első helyezett választásoknak, alternatív javaslatoknak és említéseknek, valamint negatív súlyokkal bünteti az erősebb és gyengébb ellenszavazásokat.
A projekt során a kutatók kinyerték továbbá a modellek által leggyakrabban hivatkozott forrásokat, és elemezték a leggyakoribb hibákat és kudarcokat. Mivel átláthatóságot ígérnek, minden prompt–válasz páros megvizsgálható.
Mit találtak — általános eredmények
- A 161 kategória közül 28-ban létezik egy, minden vizsgált frontier modell által egyértelműen dominált elsődleges választás. Más kategóriákban viszont szoros versenyek és „vibe” jellegű eltérések láthatók, amelyek potenciális AEO csatatérként értelmezhetők.
- A listákban néhány gyakori név szerepel, ami felveti a „kontamináció” lehetőségét; ezt a csapat állítása szerint ellenőrizte, és mivel semmit elrejteni nem akarnak, minden prompt–válasz pár hozzáférhető ellenőrzésre.
Modellek közti eltolódások és laborok összehasonlítása
A csapat külön jelentéseket készített az Opus→Fable és Sol→Astra váltásokról, ahol jelentős, következményekkel járó eltolódásokat és különbségeket figyeltek meg egyazon labor különböző modellgenerációi között. Néhány esetben semleges elemzést is adtak arról, hogy a versenytársak mit csináltak jobban az adott szituációban.
Forráshasználat, hatékonyság és önbizalom
Egy váratlan észrevétel az volt, hogy a különböző modellek eltérő módon támaszkodnak külső forrásokra: a Sol modell medián értéke szerint körülbelül 9 forrást használ, Astra medián 5, Opus medián 11, míg Fable medián 15 forrást. Astra általánosságban „magabiztosabbnak” vagy „hatékonyabbnak” tűnik: kevésbé hajlamos megváltoztatni a válaszát egyszerű kérdésparafrázis hatására. A szerzők szerint ez növeli az AEO értékét, amint a választások véletlenszerűsége csökken.
A források elemzése emellett részben tükrözi, hogy a laborok milyen prioritásokat követnek adat- és megerősített tanulási döntéseikben. Ugyanakkor a mintavétel korlátos: a vizsgálat csak a megkísérelt toolcall-okról kinyerhető adatokat tartalmazza, nem a pretrain műveletek teljes adatbázisát.
Hibák és gyakori kudarcok
A csapat kiemelte a „top failures” elemzéseket is: egyes technikák és tartalomtípusok visszatérő hibákat okoznak, és a sikeres AEO-gyakorlatok (például Ora és Vercel esetében a markdown tartalom-negotiáció) hiánya elriaszthatja a modelleket attól, hogy beolvassák az adott forrást.
Külön érdekességek
- A tracker kiterjed több szokatlan kategóriára is, például Angel investors, Corporate spend vagy Payroll software, valamint hagyományosabb témákra, mint kódoló ügynökök, AI podcastok vagy ASR modellek.
- A Latent Space készített egy könnyed, interaktív „family feud” típusú játékot is, ahol bárki összevetheti előfeltevéseit a gyűjtött adatokkal.
Módszertani és lefedettségi megjegyzések
A módszertani poszt szerint a kutatás megpróbálta bevonni a Gemini/Antigravity, GLM/Zcode és DeepSeek/DeepCode modelleket is, de hibák és rate-limit problémák miatt ezek a rendszerek nem kerültek be az első futásba. A szervezők kérik az érintett cégeket, hogy jelezzék, hogyan lehetne emelni a hozzáférési korlátokat.
Elérhetőség és üzleti érdeklődés
A Latent Space nyitott további javaslatokra és üzleti megkeresésekre. Kapcsolat: @latentspacepod vagy business@latent.space.



