KutatásA többmodelles AI-orchestration korlátja: a közös hibatető (co-failure ceiling)A tanulmány főszereplője Josef Chen és csapata, akik 67 frontier modellt 21 szolgáltatótól vizsgáltak, köztük a GPT-5.5, Claude Opus 4.8 és Gemini 3.1 Pro modelleket.4 perc olvasás
KutatásEpoch bemutatja az EBR-benchet és friss elemzéseket az AI-képességekről és sebezhetőség-keresésrőlAz Epoch AI kiadta az EBR-bench nevű új benchmarkot, amely a komplex Earthborne Rangers társasjáték ismételt lejátszásával vizsgálja, képesek-e a modellek tapasztalatból tanulni.3 perc olvasás
KutatásSWE-Bench Pro auditját modellalapú ügynökök és öt független mérnök kombinációjával végezték elA SWE-Bench Pro auditját modellalapú nyomozóügynökök alkalmazásával és öt független, tapasztalt szoftvermérnök önálló felülvizsgálatával végezték el, hogy nagyobb feladatszámot vizsgáljanak meg…1 perc olvasás
KutatásA kódolási modellek fejlődése szigorúbb, igazságosabb és megbízhatóbb értékeléseket követelA kutatói és fejlesztői közösség szerint, mivel a kódolási modellek folyamatosan javulnak, az értékelési eljárásoknak nehezebbnek, igazságosabbnak és megbízhatóbbnak kell válniuk.1 perc olvasás
KutatásFüggetlen audit: 30% hibás feladat miatt nem megbízható a SWE-Bench ProEgy friss, független audit szerint a SWE-Bench Pro, az egyik legelterjedtebb AI kódolási benchmark, nem méri megbízhatóan a csúcskategóriás kódolási képességet; az audit 30%-nyi feladatot talált…1 perc olvasás
KutatásA Golden Gate feature: hogyan manipulálható a Claude 3 Sonnet belső aktivációjaA főszereplő az Anthropic által fejlesztett Claude 3 Sonnet nyelvi modell és a hozzá kapcsolódó kutatás, amelyet 2024.2 perc olvasás
KutatásOpenAI audit: mintegy 30% hibás feladat a SWE-Bench Pro kódfelmérőbenAz OpenAI részletes auditja szerint a SWE-Bench Pro kódolási benchmark jelentős része hibás, ami torzíthatja a modellek képességeinek mérését és ezáltal a telepítési és biztonsági döntéseket.4 perc olvasás
KutatásAnthropic kutatása szerint J-space a Claude belső folyamatait nevezi meg, de a tudatosság állítása vitatottAz Anthropic közelmúltbeli kutatása azt állítja, hogy J-lens nevű eszköze képes felismerni a Claude nyelvi modellben kialakuló, még ki nem mondott fogalmakat, amelyeket J-space néven azonosít.2 perc olvasás
KutatásHiányzó elem: konkrét technológiai útvonalak az AI-futurizmusbanA cikk főszereplője az Epoch AI és a szerzők érvelése az AI-futurizmus vitáiban meglévő hiányosságról.5 perc olvasás
KutatásKoordinált navigációval csökkenthető a városi forgalmi torlódásA Google Research által a Nature Cities folyóiratban bemutatott tanulmányban „Urban congestion relief experiments through routing-app interventions” a szerzők azt vizsgálták, hogy a navigációs platformok rendszerszintű koordinációja hogyan csökkentheti a forgalmi torlódást.4 perc olvasás
KutatásAnthropic: a Claude modellben önmagától kialakult „J-tér” rejti a rejtett gondolkodástAz Anthropic kutatói a Claude nevű nyelvi modellen belül egy önmagától kialakult belső struktúrát, úgynevezett J-teret fedeztek fel, amely a modell belső aktivációiban működik.4 perc olvasás
KutatásA benchmarkok számolási kerete torzítja az AI-modellek mérésétAz AI Security Institute tesztelte a legfejlettebb nyelvi modelleket hét ismert benchmarkon, és arra jutott, hogy a közismert pontszámok félrevezetők.2 perc olvasás