Kutatáso3 Deep Research segített megoldatlan ritka gyermekbetegségek esetének felülvizsgálatában a NEJM AI-ben megjelent tanulmány szerintA Boston Children’s Hospital és a Harvard kutatóival együtt o3 Deep Research közreműködésével megjelent tanulmány a NEJM AI folyóiratban bemutatja, hogy a módszer hogyan segítette klinikusokat éveken…1 perc olvasás
KutatásLifeSciBench: új benchmark az AI élettudományi kutatás támogatásának méréséreA LifeSciBench nevű benchmarkot bemutatták, amelyet 173 biotechnológiai és gyógyszeripari kutató fejlesztett ki; 750 szakértői feladatot tartalmaz hét biológiai kutatási munkafolyamathoz.1 perc olvasás
KutatásGPT‑Rosalind jobb eredményt ért el a LifeSciBench hét munkafolyamatában, de vannak hiányosságokA LifeSciBench benchmark szerint a GPT‑Rosalind minden hét vizsgált munkafolyamatban jobb pontszámot ért el, mint a GPT‑5.5; ez a kezdeti eredmény előrelépést jelez, ugyanakkor továbbra is gyengébben…1 perc olvasás
KutatásFrontier mesterséges intelligencia-modellek részt vállaltak egy kísérleti kutatás teljes folyamatábanFrontier mesterséges intelligencia-modellek támogatták egy kutatási projekt teljes folyamatát: tanulmányok áttekintése, hipotézisjavaslat, kísérlettervezés és adatértelmezés.1 perc olvasás
Kutatás10 080 reakción tesztelve: Maria optimalizálása növelte a boronsavak és szulfonamidok hozamátMaria egy javaslatot 10 080 reakción tesztelt, majd humán kémikusok kézzel validálták reprezentatív eredményeket.1 perc olvasás
KutatásGPT-5.4 javasolta és segítette egy gyógyszervegyészeti reakció kísérleti javításátA GPT-5.4 mesterséges intelligencia a közelmúltban egy gyógyszervegyészeti projektet vitte végig irodalomáttekintéstől validált kísérleti eredményig, és váratlan módon javasolt javítást egy széles körben használt reakcióra.1 perc olvasás
KutatásAz emberi agy mint energiahatékony mintapéldány: ionikus neuromorfikus rendszerek lehetőségeiA Lawrence Livermore Nemzeti Laboratórium kutatói azt vizsgálták, hogyan adhat irányt az emberi agy működése a mesterséges intelligencia hardverfejlesztésének.3 perc olvasás
KutatásDeployment Simulation hatékonysága és a WildChat adatbázis használhatóságaAz Alignment blog kísérő posztja szerint a Deployment Simulation a leghatékonyabb reprezentatív termelési adatokkal, amelyekhez a külső értékelők gyakran nem férnek hozzá; e hiányt a nyilvános…1 perc olvasás
KutatásEszközszimulátorokkal közelítették a tesztforgalom viselkedését agentikus és állapotot tartó környezetbenA kutatók eszközszimulátorok alkalmazásával elérték, hogy a szimulált telepítések értékelési tudatossága közelítsen a valós üzemeltetési forgalom szintjéhez; a módszert agentikus telepítésekre és…1 perc olvasás
KutatásOpenAI: modellviselkedés előrejelzése telepítés-szimulációvalAz OpenAI új kutatást mutat be a modellek kiadása előtti viselkedés előrejelzésére: telepítés-szimulációt végeznek friss, azonosítatlanított felhasználói kérésekkel, és vizsgálják a jelölti modellválaszokat.1 perc olvasás
KutatásClaude Code sikerességének összehasonlítása foglalkozások szerintAz elemzés a Claude Code modell sikerességi arányait hasonlította össze különböző foglalkozások között; a legszigorúbb, verifikálható bizonyítékot (például commitolt kód) megkövetelő mérőszámon…1 perc olvasás
KutatásGazdasági kutatás: mérési keretrendszer a Claude Code skálázódásának követéséreA kutatást az Claude Code (AI-rendszer) skálázódásának követésére dolgozták ki; bemutatja, kik használják és milyen célra, hogyan változik a feladatok értéke, valamint milyen mértékben határozza meg a szakmai domainismeret a munkamenetek sikerét.1 perc olvasás