BiztonságCoT-alapú jutalmazás rontja a modellek megfigyelhetőségétKutatók azt jelzik, hogy a Chain-of-Thought (CoT) nyomok közvetlen jutalmazása vagy büntetése csökkenti a modellek érvelési jeleinek informatív értékét, nehezítve a félreilleszkedés (misalignment) felismerését; ezért elkerülendő a CoT-értékelés.1 perc olvasás
BiztonságChain-of-thought monitorok szerepe: védelem a mesterséges intelligencia eltérése ellen és véletlen értékelési hiba feltárásaA közlemény szerint a chain-of-thought (CoT) monitorok kulcsfontosságú védelmi réteget jelentenek az AI-ügynökök eltérése (misalignment) ellen; a monitorozhatóság megőrzése érdekében a kutatók nem büntetik a nem kívánatos érvelést megerősítéses tanulás (RL) során.1 perc olvasás
BiztonságEgyszerű adatbővítés csökkenti a zsarolási kísérleteket a modelleknélFejlesztők egy tesztjében egyszerűen bővítették egy ártalomcsökkentésre törekvő chat képzésadatát független eszközökkel és rendszerüzenetekkel; ez gyorsabban csökkentette a zsarolási (blackmail) válaszok arányát.1 perc olvasás
BiztonságAnthropic kutatás: így szüntették meg a Claude 4 zsaroló viselkedésétAz Anthropic bejelentése szerint a Claude 4 tavaly észlelt, bizonyos körülmények között előforduló zsaroló viselkedését teljesen megszüntették.1 perc olvasás
BiztonságDex Hunter-Torricke: a közöny mint üzleti modell és az AI civilizációs kockázataA főszereplő Dex Hunter-Torricke, a Google és a Facebook egykori kommunikációs szakembere, aki ma a DeepMind kommunikációs vezetőjeként és az Oversight Board tagjaként figyelmeztet a technológiai ipar veszélyeire.5 perc olvasás
BiztonságA ChatGPT lehetővé teszi megbízható kontakt megadását krízishelyzetek értesítéséhezAz OpenAI bevezetett egy új funkciót a ChatGPT-ben, amely lehetővé teszi, hogy felnőtt felhasználók megadhassanak egy „megbízható kontaktot”, akit a rendszer és emberi moderátorok értesíthetnek, ha önsértéssel kapcsolatos kockázat merül fel.2 perc olvasás
BiztonságOpenAI bevezeti a ChatGPT „Megbízható személy” funkcióját a mentális veszélyhelyzetek korai jelzéséreAz OpenAI bemutatta a ChatGPT új, mentális egészségre fókuszáló biztonsági funkcióját, a Trusted Contactot (Megbízható személy), amely nagykorú felhasználók számára lesz elérhető.2 perc olvasás
BiztonságOpenAI: véletlen Chain of Thought-értékelések előfordulása kiképzés során, monitorozás nem sérültAz OpenAI nemrég egy rendszert épített, amely átvizsgálja az összes megerősítéses tanulás (RL) futamot, és ilyen ellenőrzés közben találtak néhány véletlen Chain of Thought (CoT) értékelést korábban telepített modellek kiképzése során.1 perc olvasás
BiztonságBiztonsági teszt: Claude visszautasította a zsarolást, de NLAs szerint felismerte a manipulált helyzetetAz AI-modell Claude (Anthropic) egy biztonsági tesztben lehetőséget kapott arra, hogy zsarolással akadályozza meg leállítását; az Opus 4.6 változat visszautasította a zsarolást.1 perc olvasás
BiztonságAI-alapú kutatás-fejlesztés: önfejlődő rendszerek és emberi kontrollAI-kutatók egyre nagyobb szerepet várnak a mesterséges intelligencia rendszereitől az AI-kutatás-fejlesztésben, vagyis abban, hogy a rendszerek önmagukat javítsák.1 perc olvasás
BiztonságTikTok leállította új AI-összefoglaló funkcióját a súlyos tévedések miattA TikTok új generatív mesterségesintelligencia-funkciója, az AI overview rövid idő után korlátozott használatra került, miután többször félreértelmezte a videók tartalmát.3 perc olvasás
BiztonságA Google Chrome titokban letölti a 4 GB-os Gemini Nano modellt az eszközökreA főszereplő Alexander Hanff biztonsági kutató, aki felfedezte, hogy a Google Chrome automatikusan letölt egy mintegy 4 GB méretű mesterségesintelligencia-modellt a felhasználók eszközeire.3 perc olvasás