Kutatás

Mesterséges intelligenciával generált szöveg

Intology Locus előrelépése a PostTrainBenchen az automatizált AI-kutatás felé

Az Intology startup és annak Locus nevű szoftvere jár a középpontban: a cég célja az R&D automatizálása, és a legújabb Locus verzió 44,7%-os pontszámot ért el a PostTrainBenchen.

Intology Locus előrelépése a PostTrainBenchen az automatizált AI-kutatás felé

Az Intology, amelynek célja az "R&D automatizálása", egy új verziót adott ki Locus nevű szoftveréből, amely arra szolgál, hogy nagy nyelvi modelleket (LLM-eket) kutatóként használjon. A cég szerint az új Locus 44,7%-os eredményt ért el a PostTrainBench-en, egy olyan benchmarkon, amely azt méri, mennyire képesek az AI rendszerek egy adott, már meglévő (open weight) modellt továbbfejleszteni a kiindulási teljesítményükhöz képest.

Konkrét számok és összehasonlítások

  • Locus Opus 5-tel elérte a 44,7%-ot; összehasonlításképp Opus 5 önmagában, külön speciális keretrendszer nélkül, 34,1%-on áll.
  • Locus eredménye még Fable 5 (41,8%) teljesítményét is meghaladta.
  • Az Intology szerint Locus "minden frontier-agent bázistípuson jobb teljesítményt nyújt a PostTrainBench-en, és nagyobb számítási erőforrások mellett a post-trainelt modellek összességében meghaladják mind a bázisokat, mind a hivatalos, emberi instrukciókkal hangolt Qwen3-1.7B kiadást a benchmark sorozaton".
  • A cég állítása szerint az eredményeket a PostTrainBench szerzői külsőleg ellenőrizték, és a vizsgálat során szigorú adat- és csalásellenőrzések történtek.

A PostTrainBench háttere

A PostTrainBench-et először 2026 márciusában mutatták be. A bemutatkozáskor a legjobb rendszer az Opus 4.6 volt, 23,2%-kal; ez korábban 2025 szeptemberében a Claude Sonnet 4.5 által elért 9,9% fölötti növekedést jelezte.

PostTrainBench+: hosszabb GPU-idő és emberi alapvonal legyőzése

Az Intology emellett egy, a PostTrainBench-en alapuló módosított változatot (PostTrainBench+) készített, amely eltávolítja a benchmark egy-GPU-s, 10 órás falidejű korlátját, így a rendszerek nagyobb számítási idő mellett értékelhetők. Ezen a variánson az Intology szerint Locus emberi alapvonalat is meghaladott: 51,6%-os pontszámot értek el, amikor több mint 4000 órányi H100 GPU-időt használtak. Összehasonlításképp ezen a variánson Opus 4.8 44,3%-ot, GLM 5.2 pedig 42,7%-ot ért el; a Fable modell nincs tesztelve ezen a változaton.

Más területeken elért eredmények

Az Intology közlése szerint Locus egy nyelvi modellt is felfedezett és végponttól végpontig kiképzett, amely most éles környezetben fut Bubble, egy no-code alkalmazásfejlesztő startup számára. A cég állítása szerint az így üzemeltetett modell körülbelül 2,8× alacsonyabb hibaaránnyal, 5,4× alacsonyabb késleltetéssel és 105× alacsonyabb költséggel működik.

Miért fontos ez?

A bemutatott eredmények azt jelzik, hogy az AI rendszerek nagyobb szerepet vállalhatnak az AI-kutatás és -fejlesztés automatizálásában, különösen ha megfelelő "hámot" (harness) és számítási erőforrást kapnak. Az Intology esete szemlélteti, hogy a modellek teljesítménye nem csak a magukén, hanem az őket körülvevő post-training folyamatok és infrastruktúra függvénye is.

Az Intology által közölt adatok külső ellenőrzésről és csalásellenőrzésről számolnak be; a PostTrainBench és a PostTrainBench+ mutatók további összehasonlító keretet adnak annak értékelésére, milyen mértékben javíthatók a meglévő, nyílt súlyú modellek teljesítményei további post-traineléssel és nagyobb számítási ráfordítással.