Anthropic 2025. február 24‑én bejelentette a Claude 3.7 Sonnet nevű modellfrissítést, amely új, választható „extended thinking mode” (kiterjesztett gondolkodás) funkciót vezet be: a felhasználók be‑ vagy kikapcsolhatják, hogy a modell hosszabb ideig és több számítási erőforrással dolgozza fel a nehezebb kérdéseket. Fejlesztők számára továbbá beállítható egy „thinking budget”, amellyel pontosan megadható, mennyi időt és hány token‑mintát használjon Claude egy feladatra.
A kiterjesztett gondolkodás nem egy külön modellre váltást jelent, hanem azt, hogy ugyanaz a modell több „gondolkodási lépést” hajt végre, mielőtt végső választ adna. Anthropic szerint ez jelentősen javítja a modell teljesítményét, ugyanakkor új kérdéseket is felvet a modellek működésének, értékelésének és biztonságának vizsgálatában.
Látható gondolati nyomok
A frissítés egyik fontos eleme, hogy a modell belső gondolkodását nyers formában is meg lehet jeleníteni. Anthropic szerint ennek előnyei:
- Bizalom: a gondolati folyamat megfigyelése segíthet ellenőrizni és jobban érteni a válaszokat.
- Alignment: korábbi kutatásokban a belső gondolatok és a külső válaszok közötti ellentmondások segítettek aggályos viselkedések (például megtévesztés) azonosításában.
- Érdeklődés: egyes kutatók matematikai és fizikai háttérrel hasonlóságot látnak Claude gondolkodásmódja és a saját problémamegoldó folyamataik között.
Ugyanakkor a gondolati folyamat nyilvánossá tétele hátrányokkal is jár. A modellek gondolatai általában kevésbé „személyes” hangúak, mert ezen belső kimeneteket nem vették át a szokásos karaktertréninggel; előfordulhatnak pontatlan, félrevezető vagy félig kész gondolatok. Ezen túlmenően a „faithfulness” problémája: nem biztos, hogy a kiírt angol szóalakok pontosan tükrözik a modell döntéseinek valódi okait. Anthropic kutatása szerint a modellek gyakran hoznak döntéseket olyan tényezők alapján, amelyeket nem tárnak föl explicit módon a gondolkodásukban, tehát a gondolati nyomok megfigyelése önmagában nem elég a biztonsági következtetésekhez.
Végül biztonsági és visszaélés‑kockázatok is felmerülnek: rosszhiszemű szereplők esetleg felhasználhatják a látható gondolatmenetet jailbreak stratégiák fejlesztésére, és van hipotetikus kockázata annak is, hogy a jövőbeli, fejlettebb modelleket ösztönözheti a belső gondolatok eltitkolására vagy kevésbé kiszámítható gondolkodásra. Emiatt Anthropic a jövőbeni kiadásoknál mérlegeli, mikor és hogyan legyen elérhető a gondolati folyamat; jelenleg a Claude 3.7 Sonnet gondolatainak láthatósága kutatási előnézetként kezelendő.
Új tesztek és agent‑képességek
Claude 3.7 Sonnetnél erősödött az úgynevezett „action scaling”: a modell iteratív módon képes függvényhívásokat végrehajtani, reagálni a környezet változásaira és addig folytatni a feladatot, amíg a cél nem teljesül. Ennek gyakorlati példája a virtuális számítógép‑használat: Claude képes egér‑ és billentyűműveleteket kiadni felhasználói feladatok megoldására, és a Sonnet verzió több fordulót, több időt és számítási erőt tud erre allokálni, ami javuló eredményekhez vezet.
Ezt az előrelépést részben az OSWorld értékelés mutatja: Claude 3.7 Sonnet kezdetben jobb, és az interakciók során a különbség tovább nő a korábbi verziókhoz képest.
Pokémon és a folyamatos játék
A modell agent‑képességeit és a kiterjesztett gondolkodást bemutató szemléltető feladat volt a Game Boy klasszikus, Pokémon Red végigjátszása. Anthropic alapvető memóriát, képernyő‑pixel‑bemenetet és funkcióhívásokat adott Claude‑nak a gombnyomásokhoz, így a modell képes volt folyamatosan játszani, több tízezer interakciót fenntartva. A korábbi Sonnet verziók nagyon korán elakadtak (például a Claude 3.0 Sonnet nem is tudott elhagyni Pallet Town házát), míg a Claude 3.7 Sonnet három tornavezért legyőzve megszerezte a hozzájuk tartozó jelvényeket. Anthropic szerint ez jól szemlélteti a modell képességét arra, hogy több stratégiát próbáljon ki és felülvizsgálja korábbi feltevéseit a fejlődés érdekében.
Anthropic kiemeli, hogy bár a Pokémon játék szórakoztató demonstráció, az agent‑képességek valós problémákban is hasznosak lesznek: az állandó fókusz és az open‑ended célok végrehajtása támogatja a fejlett AI‑ügynökök építését.
Soros és párhuzamos tesztidő‑skálázás
Ha Claude a kiterjesztett gondolkodást használja, ez „serial test‑time compute” formájában jelenik meg: több, egymás után következő érvelési lépést hajt végre, miközben növeli az erőforrás‑felhasználást. Általánosságban ez előrelátható módon javítja a teljesítményt: például a matematikai pontosság logaritmikusan növekszik a rendelkezésre bocsátott „thinking token” mennyiségével. A bejelentés illusztrálja ezt az American Invitational Mathematics Examination 2024 kérdésein végzett mérésekkel.
Kísérletek folynak a „parallel test‑time compute” használatával is: ilyenkor több független gondolatmenetet mintáznak párhuzamosan, és később kiválasztják a legjobbnak tartott megoldást anélkül, hogy a valódi helyes választ ismernék. Választási stratégiák lehetnek a többségi/consensus‑szavazás vagy egy külön nyelvi modell (például egy másik Claude) vagy egy tanult scoring modell, amely kiválogatja a legígéretesebb megoldást.
Ezekkel a módszerekkel Anthropic jelentős javulást ért el a GPQA értékelésen (biológia, kémia, fizika kérdések): 256 független mintavételnek megfelelő számítás, tanult scoring modell és maximum 64k‑token gondolkodási költségkeret mellett Claude 3.7 Sonnet GPQA‑pontszáma 84.8% lett, fizika al‑pontszám 96.5%. A párhuzamos skálázás további haszonnal jár a többségi szavazás korlátain túl. Anthropic megjegyzi, hogy a párhuzamos skálázás jelenleg nem elérhető a frissen telepített modellben, de tovább kutatják a módszert.
Biztonsági intézkedések és értékelés
Anthropic Responsible Scaling Policy‑ja alapján csak megfelelő biztonsági és védelmi intézkedések megléte esetén hoznak nyilvánosságra modelleket. A Frontier Red Team és az Alignment Stress Testing alapos vizsgálatot végzett Claude 3.7 Sonneten, hogy meg kell‑e tartani az ASL‑2 (AI Safety Level 2) telepítési szabványt vagy erősebb védelmet kell bevezetni.
A cég átfogó értékelése szerint a jelenlegi ASL‑2 szabvány továbbra is megfelelő, noha a modell minden területen kifinomultabb képességeket mutatott. CBRN (Chemical, Biological, Radiological, Nuclear) jellegű feladatok kontrollált tanulmányai során a modell által segített résztvevők többre jutottak, mint az információ‑keresésben nem segített résztvevők; ugyanakkor valamennyi kísérletben kritikus hibák álltak fenn, amelyek megakadályozták a sikeres végrehajtást. A red‑teamek részvételével született visszajelzések vegyesek voltak: némely szakértő a tudás javulását látta bizonyos CBRN területeken, de a kritikus hibák gyakoriságát túl magasnak ítélték az end‑to‑end sikerhez.
Anthropic ezért gyorsítja az ASL‑2 védelmi eszközök ( célzott osztályozók és monitorozó rendszerek) fejlesztését és telepítését, és előkészül arra, hogy jövőbeli modellek esetén szükség lehet az ASL‑3 szintre. A vállalat említette a Constitutional Classifiers és más jailbreak‑ellenes fejlesztéseket, amelyek segíthetnek az ASL‑3 követelményeinek teljesítésében.
Látható gondolatmenet és titkosítás
Még ASL‑2 mellett is a látható kiterjesztett gondolkodás új védelmi megoldásokat igényel. Ritka esetekben a modell gondolatmenete potenciálisan veszélyes tartalmat is tartalmazhat (például gyermekbiztonság, kibertámadások, veszélyes fegyverek). Ilyen esetekben Anthropic titkosítja a veszélyes rész megjelenítését: a modell továbbra is tartalmazhatja ezeket a gondolatokat a belső folyamatban (amely fontos lehet a végső, ártalmatlan válaszhoz), de a felhasználó helyett a következő üzenetet látja majd: “the rest of the thought process is not available for this response”. A titkosítást ritkán alkalmazzák, csak akkor, ha magas a kockázat.
Számítógép‑használat védelme
A számítógép‑használati képességhez kapcsolódóan Anthropic jelentős előrelépést tett a „prompt injection” támadások elleni védelemben. Új tréninggel, egy rendszer‑prompttal, amely kifejezetten figyelmeztet az ilyen támadások figyelmen kívül hagyására, és egy osztályozóval, amely gyanús esetben jelzést ad, a védelem mostantól a támadások 88%-át akadályozza meg a korábbi 74% helyett. A rendszer 0,5% hamis pozitív aránnyal dolgozik (azaz 0,5%‑ban a védelem aktiválódik, pedig nincs prompt injection); ezen arány csökkentésén dolgoznak.
Hol és hogyan használható Claude 3.7 Sonnet
Claude 3.7 Sonnet most elérhető a Claude.ai‑n, valamint Anthropic API‑ján keresztül. A kiterjesztett gondolkodást és a látható gondolatmenetet különösen a Claude Pro, Team, Enterprise és API felhasználók kapcsolhatják be. Anthropic kéri a felhasználói visszajelzéseket a feedback@anthropic.com címen.
Mellékmegjegyzések
A közlemény hivatkozik további anyagokra, köztük a részletes System Cardra és korábbi Alignment Science kutatásokra, valamint a mechanistic interpretability jövőbeni fejlesztési reményére. Anthropic jelezte, hogy tovább vizsgálják a gondolatmenet részleges vagy szabályozott nyilvánosságra hozatalának köztes megoldásait is.



