Modellbevezetés

Mesterséges intelligenciával generált szöveg

Google bemutatja a Gemini 3.8 Flash és Flash‑Lite text-to-speech modelleket a dinamikus hangtervezéshez

A Google bemutatta a Gemini 3.8 Flash TTS és a Gemini 3.8 Flash-Lite TTS modelleket, amelyek a hagyományos statikus hangpresetek helyett kreatív hangstúdióként szolgálnak.

Google bemutatja a Gemini 3.8 Flash és Flash‑Lite text-to-speech modelleket a dinamikus hangtervezéshez

Ma a Google két új, szöveg‑hanggá alakító (text-to-speech, TTS) modellt jelentett be a Gemini családon belül: a Gemini 3.8 Flash és a Gemini 3.8 Flash‑Lite modelleket. A vállalat célja, hogy a hanggenerálást a statikus előre beállított hangoktól egy dinamikus, kreatív munkatér felé mozdítsa el, amely alkotóknak, fejlesztőknek és vállalatoknak tervezett, kiterjedtebb, érzelmileg és stilisztikailag gazdagabb audioélmények létrehozására ad lehetőséget.

Modellfelépítés és célok

  • Gemini 3.8 Flash TTS: a mélyebb kreatív irányítást és karaktertervezést célozza. Lehetővé teszi teljesen új hangok „megalkotását” természetes nyelvi promptokkal, soronkénti, részletes irányítással (színészi utasítások, tempó, dialektusváltások, visszacsatolás). Alkalmas játékokra, hangoskönyvekre, podcastokra és interaktív médiára.

  • Gemini 3.8 Flash‑Lite TTS: magas volumenű, költséghatékony skálázásra optimalizált modell. Célja a nagy mennyiségű szinkron, audiotartalom-előállítás és kifejező hangalapú ügynökök kiszolgálása finomhangolt tónus‑, tempó‑ és kifejező árnyalat‑vezérléssel.

Generatív hangtervezés és hangkönyvtár

A Gemini 3.8 Flash-sel a felhasználók a 30 előre definiált eredeti hangról elmozdulva gyakorlatilag végtelen könyvtárat hozhatnak létre: szerep, akcentus és hangjellemzők természetes nyelvi utasításokkal több mint 100 nyelven és nyelvjárásban szabályozhatók. A rendszerhez több mint 2 000 gyártásra kész hang tartozik, lefedve regionális változatokat, például mexikói spanyolt, quebeci franciát és skót angolt.

A hang-replikáció lehetősége révén egyetlen 30 másodperces hangmintából is újraalkotható egy következetes vokális profil — ez a funkció beépített beleegyezés-ellenőrzéssel, SynthID vízjellel és C2PA hitelesítéssel működik a fejlesztők és a hangszereplők védelmére.

Hamarosan érkezik a „voice remix” funkció, amely lehetővé teszi meglévő hangok timbre‑, pitch‑, tempó‑ és akcentus‑finomhangolását természetes nyelvi promptokkal.

Finom, soronkénti teljesítményirányítás

Mindkét modell soronkénti, precíz irányítást ad a szöveg felmondására: a szerzők írhatnak „színpadi utasításokat” vagy hagyhatják, hogy a Gemini a természetes szkriptjelek alapján vezérelje a lejátszást (például nyugodt ügyfélszolgálati ügynök vagy suttogós feszültségjelenet). A modellek támogatják a hosszú formátumú generálást, órákon át tartó, folyamatos narrációt minimális hangeltolódással, natív kétbeszélős jeleneteket egyetlen szkriptből, valamint nem verbális reakciókat és visszajelzéseket (<laughs>, <sigh>, |mhm| stb.) a természetes párbeszédtextúra előállításához.

Teljesítmény és nyelvi lefedettség

A Gemini 3.8 Flash TTS vezető helyezést ért el Hume AI Voice Design Benchmark értékelésében (összesített pontszám: 71,4), valamint a kiejtésmodellezésben (60,8). A Gemini 3.8 Flash és a Flash‑Lite a Hume AI Overall Quality Index rangsorában az első és a második helyet foglalja el. A Voice Arena vak emberi preferenciaértékeléseiben mindkét modell kiemelkedő helyezést ért el kulcsfontosságú nyelveken, többek között japán, brazil portugál, vietnami, modern standard arab, mexikói spanyol és hindi nyelven. A modellek több mint 100 nyelvet támogatnak.

Megbízhatóság, beleegyezés és átláthatóság

A Google kiemeli, hogy hangteremtési és replikációs funkcióit szigorú biztonsági és etikai intézkedésekkel építette fel. A hangreplikáció esetén szükséges a hang tulajdonosának verbális beleegyezése, amelynek felvétele meg kell, hogy egyezzen a referencia beszélővel. Minden Gemini Audio modellel létrehozott hangklipbe beágyazott SynthID vízjel kerül, amely érzékelhetőlen, de detektálható módon segíti az AI‑generált beszéd azonosíthatóságát. A részletes felelősségvállalási és biztonsági megközelítés a modellkártyán található.

Hozzáférés és integrációk

A fejlesztők ma már kipróbálhatják az új beszédgenerálási képességeket a Google AI Studio felületén. A Gemini API-n keresztül platformok és fejlesztők (például Agora, LiveKit, Pipecat, Vercel) könnyen beépíthetik és üzemeltethetik a magas teljesítményű beszédgenerálást. A Google partnerekként említ olyan cégeket, mint a Figma, HeyGen, Linguana, Wondercraft, 99.co és Ollang, amelyek a modelleket globális szinkronizálás, regionális akcentusok lokalizálása és nagyszabású konverzációs ügynökök működtetése céljából integrálják.

A bevezetés üteme:

  • Gemini 3.8 Flash TTS: ma indulóan elérhető fejlesztőknek a Gemini API‑ban és a Google AI Studio‑ban; vállalati API‑hozzáférés hamarosan Gemini Enterprise‑on keresztül; mindenki számára elérhető lesz a Gemini Notebookban.
  • Gemini 3.8 Flash‑Lite TTS: ma indulóan elérhető fejlesztőknek a Gemini API‑ban és a Google AI Studio‑ban; vállalati API‑hozzáférés hamarosan Gemini Enterprise‑on keresztül; mindenki számára a Google Vids szolgáltatásban lesz elérhető.

Fontos korlátozások: a Voice replication (hangreplikáció) a Google AI Studio‑ban jelenleg nem érhető el Illinois, Texas, az EEA, az Egyesült Királyság, Svájc és India területén.

Összegzés

A Gemini 3.8 Flash és Flash‑Lite modellek célja, hogy egyrészt mélyebb kreatív irányítást adjanak a hangalkotásban (Flash), másrészt költséghatékony, nagy volumenű alkalmazásokhoz biztosítsanak megbízható, kifejező hanggenerálást (Flash‑Lite). A Google szerint a modellek erős nyelvi lefedettséget, fejlett személyre szabhatóságot és beépített biztonsági mechanizmusokat kínálnak, miközben a fejlesztők már ma hozzáférhetnek a Gemini API‑n és a Google AI Studio‑n keresztül.