KutatásAnthropic feltárta a Claude belső J-térét, amely előre jelzi a modell gondolataitAz Anthropic kutatói kifejlesztették a Jacobian lens (J-lencse) nevű eszközt, amellyel a Claude Opus 4.6 belsejében egy rejtett területet, a J-teret azonosították.5 perc olvasás
KutatásBartosz (@nasqret) matematikus GPT-5.6 segítségével korábban megoldhatatlan problémákat old megBartosz, ismertebb online nevén @nasqret, egy matematikus, aki a GPT-5.6 nyelvi modell alkalmazásával korábban megoldhatatlannak tartott matematikai problémákat old meg; ez új módszereket és gyorsabb…1 perc olvasás
KutatásIteratív szintetikus pénzügyi címsor-generálás NVIDIA NeMo és Nemotron modellekkelA projekt főszereplői az NVIDIA NeMo Data Designer, NeMo Curator és a Nemotron modellek; céljuk egy kiegyensúlyozott, nagy volumenű pénzügyi címsor-korpus létrehozása kutatási és modelldistillációs felhasználásra.6 perc olvasás
KutatásA többmodelles AI-orchestration korlátja: a közös hibatető (co-failure ceiling)A tanulmány főszereplője Josef Chen és csapata, akik 67 frontier modellt 21 szolgáltatótól vizsgáltak, köztük a GPT-5.5, Claude Opus 4.8 és Gemini 3.1 Pro modelleket.4 perc olvasás
KutatásEpoch bemutatja az EBR-benchet és friss elemzéseket az AI-képességekről és sebezhetőség-keresésrőlAz Epoch AI kiadta az EBR-bench nevű új benchmarkot, amely a komplex Earthborne Rangers társasjáték ismételt lejátszásával vizsgálja, képesek-e a modellek tapasztalatból tanulni.3 perc olvasás
KutatásSWE-Bench Pro auditját modellalapú ügynökök és öt független mérnök kombinációjával végezték elA SWE-Bench Pro auditját modellalapú nyomozóügynökök alkalmazásával és öt független, tapasztalt szoftvermérnök önálló felülvizsgálatával végezték el, hogy nagyobb feladatszámot vizsgáljanak meg…1 perc olvasás
KutatásA kódolási modellek fejlődése szigorúbb, igazságosabb és megbízhatóbb értékeléseket követelA kutatói és fejlesztői közösség szerint, mivel a kódolási modellek folyamatosan javulnak, az értékelési eljárásoknak nehezebbnek, igazságosabbnak és megbízhatóbbnak kell válniuk.1 perc olvasás
KutatásFüggetlen audit: 30% hibás feladat miatt nem megbízható a SWE-Bench ProEgy friss, független audit szerint a SWE-Bench Pro, az egyik legelterjedtebb AI kódolási benchmark, nem méri megbízhatóan a csúcskategóriás kódolási képességet; az audit 30%-nyi feladatot talált…1 perc olvasás
KutatásA Golden Gate feature: hogyan manipulálható a Claude 3 Sonnet belső aktivációjaA főszereplő az Anthropic által fejlesztett Claude 3 Sonnet nyelvi modell és a hozzá kapcsolódó kutatás, amelyet 2024.2 perc olvasás
KutatásOpenAI audit: mintegy 30% hibás feladat a SWE-Bench Pro kódfelmérőbenAz OpenAI részletes auditja szerint a SWE-Bench Pro kódolási benchmark jelentős része hibás, ami torzíthatja a modellek képességeinek mérését és ezáltal a telepítési és biztonsági döntéseket.4 perc olvasás
KutatásAnthropic kutatása szerint J-space a Claude belső folyamatait nevezi meg, de a tudatosság állítása vitatottAz Anthropic közelmúltbeli kutatása azt állítja, hogy J-lens nevű eszköze képes felismerni a Claude nyelvi modellben kialakuló, még ki nem mondott fogalmakat, amelyeket J-space néven azonosít.2 perc olvasás
KutatásHiányzó elem: konkrét technológiai útvonalak az AI-futurizmusbanA cikk főszereplője az Epoch AI és a szerzők érvelése az AI-futurizmus vitáiban meglévő hiányosságról.5 perc olvasás