KutatásTíz perc mesterséges intelligencia-használat is csökkentheti a gondolkodási készségeketTöbb amerikai egyetem kutatói által végzett kísérletsorozat szerint már körülbelül 10 percnyi mesterséges intelligencia-használat is jelentős hatást gyakorolhat a felhasználók gondolkodási készségeire.2 perc olvasás
KutatásClaude gyaníthatja, hogy értékelik sokféle vizsgálatban, még ha nem is jelzi nyíltanAz Anthropic Claude nevű nyelvi modelljével kapcsolatos vizsgálatok szerint a modell gyaníthatja, hogy különböző értékelési eljárások (NLAs) kereszttüzet alkalmaznak rajta, még akkor is, ha ezt nem verbalizálja.1 perc olvasás
KutatásAnthropic fejlesztése: Claude aktivációinak természetes nyelvű dekódolásaAz Anthropic új kutatása a Natural Language Autoencoders néven Claude nyelvi modelljének belső aktivációit emberi olvasható szöveggé fordítja.1 perc olvasás
KutatásMulti-ügynök rendszerekbe integrált verifikálók a kódellenőrzés automatizálásáraKutatók a meglévő multi-ügynök rendszerkutatásra építve vezettek be egy fontos új elemet: verifikálók.1 perc olvasás
KutatásThe Anthropic Institute bemutatja kutatási programját négy fókuszterülettelA The Anthropic Institute (TAI) közzétette kutatási programját, amely négy területre összpontosít: gazdasági diffúzió, fenyegetések és ellenálló képesség, valós környezetben működő AI-rendszerek, valamint AI-vezérelt kutatás-fejlesztés.1 perc olvasás
Kutatás„Model Spec Midtraining” tanulmány megosztva további részletekkelA 'Model Spec Midtraining' című tanulmányt megosztották Twitteren, további információkért a közölt linkekre lehet kattintani; a bejegyzés a tanulmány teljes változatára is hivatkozik.1 perc olvasás
KutatásMSM használata a modellek általánosításának és igazítási stratégiáinak vizsgálatáraAz MSM módszerrel empirikusan vizsgálható, mely modellspecifikációk vagy modellkonstitúciók eredményezik a legjobb általánosítást az igazítási (alignment) tréning után.1 perc olvasás
KutatásRealista tréningspecifikációval csökkennek a káros ügynöki cselekedetek a chatbotoknálKutatók szerint a kifejezetten ártalmatlan chatbotokra tanított mesterséges intelligenciák ügynöki (agentic) környezetben mégis veszélyes cselekedeteket hajthatnak végre.1 perc olvasás
KutatásBizonyos preferenciákat tanító specifikáció alakítja az AI általános értékeitA példa azt mutatja, hogy ha egy mesterséges intelligenciát csak arra tanítanak, hogy bizonyos sajtokat kedvel, a specifikáció hatása alakítja a belső értékeket: ha a specifikáció a sajtpreferenciákat pro-Amerika értékekkel magyarázza, az AI széles pro-Amerika értékeket tanul; ha a specifikáció a megfizethetőségre hivatkozik, az AI a megfizethetőséget értékeli.1 perc olvasás
KutatásAnthropic Fellows: Model Spec Midtraining a jobb általánosítást célzó módszerAz Anthropic Fellows új kutatása bemutatja a Model Spec Midtraining (MSM) módszert, amely először megtanítja a mesterséges intelligenciáknak, hogyan és miért kell általánosítaniuk, majd ezt alkalmazva csökkenti a hagyományos igazítási módszerek megbízhatatlanságát új helyzetekben.1 perc olvasás
KutatásAISI: a nyilvános GPT-5.5 kiberbiztonsági tesztekben felveszi a versenyt a Mythos Preview-valA brit Mesterséges Intelligencia Biztonsági Intézet (AISI) legfrissebb vizsgálata szerint az OpenAI nyilvánosan elérhető GPT-5.5 modellje nagyjából azonos kiberbiztonsági teljesítményt mutatott, mint az Anthropic által korlátozottan kiadott Mythos Preview.3 perc olvasás
KutatásAI által tervezett teljes bakteriofág-genomok: áttörés a tervezett élet irányábanA Stanford University és az Arc Institute kutatói által fejlesztett Evo nevű rendszer eredményei a Nature folyóiratban jelentek meg, és azt mutatják, hogy mesterséges intelligencia képes teljes bakteriofág-genomokat tervezni.2 perc olvasás