Anthropic belső csapata bemutatta, hogyan alakítják át a Claude Code, Claude Tag és Fable a termékfejlesztést, a csapatmunkát és a biztonságot. A cikk a konferencia-beszélgetés szerkesztett átírásán alapul, amelyben Cat Wu és Thariq Shihipar beszéltek a technológiákról, a kódbíráltokról, modellekről és a belső használati gyakorlatról ("ant fooding").
Mivel változott a napi munka?
- A Claude Code megjelenése (eredetileg a Sonnet 3.7 bejelentésnél szerepelt; a csapat szerint a termék februárban jelent meg az előző évben) óta a munkafolyamatok jelentősen átalakultak: a korábbi részletes felügyeletet nagyban csökkentette az automatikus üzemmód és a modellek minősége.
- Cat Wu szerint a csapat sok rutinszerű implementációt átruház Claude-ra, így több idő marad a termékélmény és kreatív feladatok tervezésére.
- Thariq Shihipar hasonlóan gyorsabb, magasabb minőségi elvárásokról beszélt: Fable-t videószerkesztésre is használja, és azt szeretné, hogy a bemenetek megfeleljenek a márka szigorú elvárásainak pár órán belül.
Mely hagyományos szoftvermérnöki gyakorlatok változtak?
- Prioritás: a fejlesztés költsége csökkent, így a termékíz és üzleti érzék értéke nőtt; a tervezést és döntéshozatalt gyorsabban kell hozni (hat–tizenkét hónapról akár egy hétre rövidülő időkeret).
- Újrafelírás: Thariq szerint a „rewrites are now good” — újraírások elfogadottabbak lettek, ha jó tesztkészlet áll rendelkezésre.
- Eszközhasználat: a csapat törekszik alacsony eszköz-kardinálitásra, és a fájlmódosító eszközt például azért tartják meg, mert determinisztikusan jelzi a fájlváltoztatásokat a felhasználói UI számára.
Claude Tag: együttműködési réteg és belső használat
- Claude Tag egy Slack-integrációként működő, többjátékos Claude-instancia, amely proaktív és csapatmemóriát tartalmaz: megjegyzi csapatteljesítési preferenciákat és folyamatosan monitorozhat csatornákat.
- Anthropic belső verziója a Claude Code termékfejlesztésben jelenleg a termék mérnöki PR-ek 65%-át hozza be (ez a Claude Code csapaton belüli statisztika).
- Claude Tag különösen hasznos nem mérnöki szerepkörökben is: keresésként a vállalati Slackben, metrikák lekérdezésére, funkciók leírására, és szervezési feladatokra.
- A csapat tapasztalata szerint a nyilvános csatornák és a nyílt használat segítik az eszköz elsajátítását és a kollektív normák kialakulását.
Kódellenőrzés és automatizálás
- A fontos kódrészeknél (például a rendszerpromptnál) vannak kódgazdák, akik manuálisan hagyják jóvá a PR-eket.
- Számos PR-t egy GitHub-kódreview bot vizsgál meg, és az automatizált review egyre gyakrabban kiváltja az emberi ellenőrzést az "outer layers" esetén, miután hónapokon át tesztelték és finomították az eval készleteket.
- Incident review során azokat a PR-eket, amelyek problémát okoztak, bevonják az eval készletbe, hogy a jövőbeli automatizált ellenőrzés megtanulja elkapni ezeket a regressziókat.
Modellek, evalok és a rendszerprompt
- Anthropic célja, hogy új modelleket drop-in módon cseréljen: új modell bevezetésekor az egész eval-készletet lefuttatják, és azt várják, hogy az új modell legalább olyan jó legyen, mint a korábbi (például Fable jobb lehet Opus 4.8-nál bizonyos feladatokban).
- A rendszerpromptot a csapat csökkentette: a Claude Code rendszerpromptja körülbelül 80%-kal rövidebb lett az Opus 4.8 és Fable bevezetésével. Ennek oka, hogy a korszerű modellek kevésbé igénylik a részletes példákat és sok „ne tedd X” típusú tiltást — ezek gyakran rontják a teljesítményt vagy összezavarják a modellt.
- A csapat modellezési megközelítése: kevesebb kemény tiltás, több kontextus, és pontosságra törekvő, viselkedési evalok építése (például hogy a modell folytassa-e a munkát, amikor a felhasználó akarja).
Auto mode és biztonság
- Auto mode-ot Anthropicon belül január óta használnak; nyilvánosan március 24-én tettek elérhetővé egy formát.
- A csapat jelentős számú red teaminget és több ezer evalt végzett az auto mode biztonságosabbá tételére. Állításuk szerint a fő kockázati kategóriák (prompt injection, adat-kivitel) esetében a kockázat alacsonyabb, mint az átlagos emberi ellenőrzőé.
- Auto mode dinamikusan kezeli a jogosultságokat, együttműködik a sandboxing infrastruktúrával, és egy Sonnet osztályozó figyeli a hívásokat és a kontextust. Claude Tag az auto mode-ot használja, ami fontos a Slack-szerű környezetekben a prompt injection elleni védelemhez.
- Kiegészítő megoldások: hitelesítés injektálás (credential injection) a proxykon keresztül, trusted devices a remote control használóknak, és lehetőség egyedi hitelesítések kiosztására a Claude Tag számára az auditálhatóság javítása érdekében.
Konkrét termék- és működési megfigyelések
- Remote control (mobilról CLI-s Claude Code kontroll) viszonylag egyszerűnek tűnt a vezetőknek, de széles körben népszerű munkafolyamattá vált: több fejlesztő este a kanapéról mobilról irányítja a futó helyi munkameneteket.
- Claude Code elkezdtek belsőleg futtatni Bun-in-Rust-ra áttéve, és a váltásról a csapat szerint belső forgalmazás történt június 17-én.
- Fable alkalmas videószerkesztésre: Thariq egy konferencia-előadás nyers fájljaiból készített publikálható szerkesztést Fable segítségével (transzkripció, slide-insert, dinamikus képkivágás, ffmpeg/Remotion használat).
Munkakultúra, ambíció és tanulás
- Anthropicnál hangsúlyozzák a „work in public” szemléletet és a belső dogfoodingot (ant fooding). A nyílt csatornák és a nyilvános használat segít a csapatoknak gyorsan tanulni egymástól.
- A vezetők azt javasolják, hogy a mérnökök és PM-ek legyenek ambiciózusabbak: a modellek átvesznek rutinfeladatokat, így a szakembereknek nagyobb, magasabb értékű munkákra kell törekedniük.
Mire nem jó még a modell?
- UX és dizájn ízlés: Cat Wu szerint a modellek még nem hoznak mindig kifinomult, örömteli interfészélményt; a webes és interakciós dizájn terén további előrelépést várnak.
- Felfedezési területek: Thariq szeretné, ha a modellek jobban tudnának a valós világgal interakcióba lépni, például tudományos kísérletek összehangolásában.
Záró megjegyzések
- Anthropic tapasztalatai alapján a gyorsabb építés és az automatizált review rendszerek bevezetése lehetséges és hasznos, de hónapokig tartó eval- és biztonsági munkát igényel.
- Kulcsfontosságú elemek: auto mode, robusztus eval készletek, csapatmemória (Claude Tag), és a belső dogfooding mint a piacra lépés szűrője.
Az interjú részletes videofelvétele és a teljes átirat a szervezők szerint elérhető YouTube-on; a fenti összefoglaló a beszélgetés legfontosabb pontjait foglalja össze.



