A nyílt forráskódú text-to-speech (TTS) modellek megjelenési üteme rendkívüli volt: a Hugging Face Hubon (2026. szeptember 30-i állapot) több mint 8 000 TTS modell érhető el. Ugyanakkor az értékelés nem tartott lépést ezzel a gyorsasággal: a gyakorlati módszerek fragmentáltak és nem standardizáltak.
A humán preferencia, például MOS vagy MUSHRA, továbbra is aranystandard; ennek gyakorlati referenciapontjai az arena-alapú rangsorok, mint a TTS Arena v2, Artificial Analysis és Voice Arena. Ezek az „összehasonlító” arénák két modell kimenetét mutatják meg a felhasználóknak és preferenciaválasztásokat gyűjtenek, majd Elo‑szerű rangsorolást számítanak (többnyire Bradley–Terry modellel).
Az arena-formátumnak azonban megvannak a korlátai: nem skálázódik a TTS‑kiadások tempójához. Ennek egyik oka, hogy kereskedelmi API‑modellek egyszerűen bekapcsolhatók egy API‑kulccsal, míg az open‑weights modelleket hosztolni és kiszolgálni kell az aréna üzemeltetőjének. Ennek következményeként az arena‑stílusú listákon az open‑source modellek alulreprezentáltak: 2026. szeptember 30-án az Artificial Analysis 92 modellje közül mindössze 16 volt open‑weights, hasonló torzulás látszik a Voice Arena‑on is. További problémát jelent a voksadók változó következetessége: egy aréna sem garantálhatja, hogy ugyanazok a kritériumok és ugyanazok a felhasználók hosszú időn át konzisztensen értékelnek.
Ebből a motivációból jött létre az Open TTS Leaderboard, amely objektív mérőszámokra támaszkodva értékeli a modelleket a teljesítmény különböző aspektusaiban:
- Intelligibilitás: WER és CER (word/character error rate) a prompt és a generált hang ASR‑átiratának különbsége alapján, a Qwen3 ASR modell segítségével (a Open ASR Leaderboardon top helyezett nyílt forráskódú ASR).
- Sebesség: inverz real‑time factor (RTFx) köteges offline inferenciára H200 GPU-n, valamint time‑to‑first‑audio (TTFA) a streaming/latencia jellemzésére batch=1 esetén H200 GPU-n és CPU‑n.
- Beszélő‑hasonlóság: cosine similarity (SIM) WavLM beszélő‑beágyazások alapján a generált hang és a referenciaklip között.
Az objektív mérőszámokra építve egy modell értékelése hetekről órákra rövidül: a voksok gyűjtése helyett az automatizált értékelés gyorsan lefuttatható.
Fontos: az Open TTS Leaderboard nem kívánja kiváltani a humán preferencia alapú értékeléseket. Az ASR‑alapú WER inkább az érthetőséget proxyzza, a SIM pedig a hangazonosság megtartását becsüli — egyik sem mér természetességet, expresszivitást vagy hallgatói preferenciát. Ugyanakkor ezek a metrikák segíthetnek abban, hogy arena‑típusú rangsorok mely modelleket vegyék be emberi összehasonlításra.
Többnyelvű és hangklónozásra fókuszáló értékelés
A leaderboard alapnézetében a modelleket az angol WER makroátlaga szerint rangsorolják a Seed TTS Eval (paper) és a CV3 Eval (zero shot) angol splitjein. Angol WER‑ben a hexgrad/Kokoro-82M, Supertone/supertonic-3 és fishaudio/s2-pro vezetnek, míg a Pareto‑diagramok segítenek vizualizálni a WER, köteges inferencia (RTFx) és modellméret kompromisszumait.
Az angol teljesítmény nem feltétlenül ad jó betekintést más nyelvekre: több nyelv be‑és kikapcsolható a rangsoroláshoz. A Seed TTS Eval csak angol és kínai hangmintákat tartalmaz, így a többi nyelv esetén a pontszámok a CV3 Eval (zero shot) eredményei. Kínai, japán és koreai esetén karakteralapú nyelvek lévén CER szerepel, és az „Average WER” makroátlag a nyelvek átlaga.
A többnyelvű mezőny erős szereplői között említendő a k2-fsa/OmniVoice, fishaudio/s2-pro és FunAudioLLM/Fun-CosyVoice3-0.5B-2512.
A „Voice cloning” bekapcsolásával azon modellek, amelyek támogatják a referenciahang alapú szintézist az adott nyelveken, összehasonlíthatók. A táblázatban megjelent egy SIM oszlop a beszélő‑hasonlóságra, és további Pareto‑diagramok mutatják a SIM, a köteges inferencia és a méret közötti trade‑offokat. Néhány modell, például a bosonai/higgs-tts-3-4b és az openbmb/VoxCPM2, jobb átlag‑WER‑t ér el hangklónozás esetén, amikor referencia audio áll rendelkezésre.
Hallgasd meg, hasonlítsd össze és szavazz
A számok csak részben mondanak el mindent: a humán preferencia továbbra is végső döntő. A „Listen” fül alatt elérhetők azok a generált kimenetek, amelyek mögött a metrikák állnak, így közvetlenül össze lehet hasonlítani a modellek hangját. A felhasználó kiválaszthatja a nyelvet/adatbázist, hogy szeretne‑e hangklónozást összehasonlítani, és megadhat konkrét modelleket vagy véletlenszerű mintát hallgathat.
A „Listen” fül hiányosságot tölt be a meglévő TTS rangsorok között: helyet ad a kimenetek felfedezésének. A felhasználók visszajelzést is adhatnak a generált hangokra; ha elegendő szavazat gyűlik össze, ezeket az adatokat később be lehet vonni a rangsorba. A szerkesztők kérik, hogy a szavazók Hugging Face fiókkal jelentkezzenek be, hogy kiszűrjék a spamet és a botokat.
Streaming teljesítmény
A „Streaming” fül a streaming képességeket hasonlítja össze: a modelleket TTFA (time‑to‑first‑audio) szerint rangsorolják, ami azt méri, mennyi idő telik el a modell lekérdezése és az első lejátszható hangdarab érkezése között — fontos mérőszám hangalapú ügynökök és interaktív alkalmazások számára.
Streaming API‑val rendelkező modelleknél (✅ a „Streaming API” oszlopban) a TTFA az első hangdarab érkezéséig tart; nem‑streaming modelleknél a teljes megszólalás legenerálódásáig, mert lejátszás csak akkor kezdődhet. Minden modellt batch=1‑ben futtatnak ugyanazon 50 angol CV3‑Eval prompton, ugyanazon hardveren és alapértelmezett hangon; az első 3 mérést bemelegítésként eldobják, és a fennmaradók medián TTFA‑ját jelentik.
Az alapnézet H200 GPU‑ra mutat eredményeket, de CPU‑eredmények is elérhetők néhány (de növekvő számú) modellre. A kyutai/pocket-tts különösen jó streaming teljesítményt mutat mind GPU‑n, mind CPU‑n.
Következtetés és közösségi részvétel
Az Open TTS Leaderboard célja, hogy lépést tartson a TTS modellek gyors megjelenésével, és hogy a közösség alakítsa: a fejlesztők várják a visszajelzéseket, hogy az értékelések relevánsak és informatívak maradjanak. Jelenleg a fókusz az open‑source modelleken és a többnyelvű teljesítményen van, mivel az angol nem jó általános helyettesítő más nyelvekhez.
Hamarosan nyilvánossá teszik az értékelő scripteket is, hasonlóan az Open ASR Leaderboard repójához, így GitHub Issues és PR‑eken keresztül közvetlenül lehet majd javaslatokat és módosításokat benyújtani. A projekt arra bíztat: formáljuk együtt a TTS értékeléseket.



