KutatásFrontier mesterséges intelligencia-modellek részt vállaltak egy kísérleti kutatás teljes folyamatábanFrontier mesterséges intelligencia-modellek támogatták egy kutatási projekt teljes folyamatát: tanulmányok áttekintése, hipotézisjavaslat, kísérlettervezés és adatértelmezés.1 perc olvasás
Kutatás10 080 reakción tesztelve: Maria optimalizálása növelte a boronsavak és szulfonamidok hozamátMaria egy javaslatot 10 080 reakción tesztelt, majd humán kémikusok kézzel validálták reprezentatív eredményeket.1 perc olvasás
KutatásGPT-5.4 javasolta és segítette egy gyógyszervegyészeti reakció kísérleti javításátA GPT-5.4 mesterséges intelligencia a közelmúltban egy gyógyszervegyészeti projektet vitte végig irodalomáttekintéstől validált kísérleti eredményig, és váratlan módon javasolt javítást egy széles körben használt reakcióra.1 perc olvasás
KutatásAz emberi agy mint energiahatékony mintapéldány: ionikus neuromorfikus rendszerek lehetőségeiA Lawrence Livermore Nemzeti Laboratórium kutatói azt vizsgálták, hogyan adhat irányt az emberi agy működése a mesterséges intelligencia hardverfejlesztésének.3 perc olvasás
KutatásDeployment Simulation hatékonysága és a WildChat adatbázis használhatóságaAz Alignment blog kísérő posztja szerint a Deployment Simulation a leghatékonyabb reprezentatív termelési adatokkal, amelyekhez a külső értékelők gyakran nem férnek hozzá; e hiányt a nyilvános…1 perc olvasás
KutatásEszközszimulátorokkal közelítették a tesztforgalom viselkedését agentikus és állapotot tartó környezetbenA kutatók eszközszimulátorok alkalmazásával elérték, hogy a szimulált telepítések értékelési tudatossága közelítsen a valós üzemeltetési forgalom szintjéhez; a módszert agentikus telepítésekre és…1 perc olvasás
KutatásOpenAI: modellviselkedés előrejelzése telepítés-szimulációvalAz OpenAI új kutatást mutat be a modellek kiadása előtti viselkedés előrejelzésére: telepítés-szimulációt végeznek friss, azonosítatlanított felhasználói kérésekkel, és vizsgálják a jelölti modellválaszokat.1 perc olvasás
KutatásClaude Code sikerességének összehasonlítása foglalkozások szerintAz elemzés a Claude Code modell sikerességi arányait hasonlította össze különböző foglalkozások között; a legszigorúbb, verifikálható bizonyítékot (például commitolt kód) megkövetelő mérőszámon…1 perc olvasás
KutatásGazdasági kutatás: mérési keretrendszer a Claude Code skálázódásának követéséreA kutatást az Claude Code (AI-rendszer) skálázódásának követésére dolgozták ki; bemutatja, kik használják és milyen célra, hogyan változik a feladatok értéke, valamint milyen mértékben határozza meg a szakmai domainismeret a munkamenetek sikerét.1 perc olvasás
KutatásSzükség van új értékelési módszerekre a modellek megbízható méréséhezTejal Patwardhan, a frontier evals csapat vezetője beszélt Andrew Mayne-nel arról, hogy a hagyományos benchmarkok telítődnek vagy manipulálhatók, ezért fontos új, átfogóbb módszereket alkalmazni a modellek előrehaladásának mérésére és előrejelzésére.1 perc olvasás
KutatásGoogle és UC San Diego 2000 nyugdíjas Pixel-telefont klaszterez adatközpontnakA Google és a UC San Diego bejelentettek egy kísérleti „adatközpontot”, amely 2 000 leszerelt Pixel okostelefon alaplapjaira épül.2 perc olvasás
KutatásAI-alapú próbálkozás: egy startup megkísérli elkészíteni a GTA 6-ot a hivatalos megjelenés előttA főszereplő a Hyperecho nevű mesterségesintelligencia-startup alapítója, Hszü Ce-ven, aki egy „vibe coding” módszerrel próbálja meg lefejleszteni a Grand Theft Auto VI-ot a Rockstar Games hivatalos megjelenése előtt.2 perc olvasás