Modellbevezetés

Voxtral TTS: természetes hangzásban felülmúlja az ElevenLabs Flash v2.5-öt, v3-minőség érzelemvezérléssel

A főszereplő a Voxtral TTS beszédszintetizátor, amelyről az értesítés szerint emberi értékelésekben természetességben jobb teljesítményt nyújt, mint az ElevenLabs Flash v2.5, és megfelel az ElevenLabs v3 minőségének érzelemvezérlés mellett.

Voxtral TTS: természetes hangzásban felülmúlja az ElevenLabs Flash v2.5-öt, v3-minőség érzelemvezérléssel

Új szereplő lépett a beszédszintézis mezőjére: a Voxtral TTS egy 4 milliárd paraméteres (4B) modellel érkezik, amelyet gyártási környezetbe szántak, és amelyet a fejlesztők szerint kifejezetten természetes hangzásra optimalizáltak.

Emberi preferencia-tesztek és minőségi összevetés

A Voxtral TTS az ElevenLabs Flash v2.5 modellel szemben végzett emberi összehasonlító vizsgálatokon a természetesség szempontjából jobb eredményt ért el: a zászlóshajó hangoknál a Voxtral 58,3%-os győzelmi arányt mutatott a preferencia-tesztekben. A hangtestreszabás terén pedig a Voxtral 68,4%-os előnyt ért el a Flash v2.5-höz képest.

A közlemény szerint a Voxtral minőségileg eléri az ElevenLabs v3 szintjét, miközben további vezérlési lehetőségeket kínál: a rendszer érzelemvezérlést biztosít, így a kimenet kontextus alapján (például semleges, vidám, szarkasztikus és más hangulatok) képes természetesebb, kevésbé „robotikus” megszólalásra.

Teljesítmény és integráció

A modell valós idejű használatra is alkalmas: a jelentés 70 ms körüli modell-latenciát említ, és körülbelül ~9,7× valós idejű feldolgozási tényezőt (real-time factor). A Voxtral natív streamelést támogat, és a kész megoldás integrálható meglévő beszéd-felismerő (STT) és nagy nyelvi modell (LLM) stackekbe.

Hangklónozás és adaptáció

A Voxtral képes hangmásolatra három másodpercnyi mintából: állítólag átvállalja a hang tónusát, személyiségét, ritmusát és intonációját. A klónozás „zero-shot” módon működik, tehát finomhangolás nélkül alkalmazkodik a forrásanyaghoz.

Licencelés és üzemeltetési lehetőségek

A model súlyai nyíltan hozzáférhetők CC BY-NC 4.0 licenc alatt, ami lehetővé teszi a saját infrastruktúrára történő telepítést és a vállalati vagy egyéni hangkönyvtárak bővítését (a licenc non-commercial feltételeit figyelembe véve).

Összegzés

A Voxtral TTS kisméretű, gyártásra tervezett modellként pozícionálja magát: a közlemény szerint természetesebb hangzást kínál az ElevenLabs Flash v2.5-nél, eléri az ElevenLabs v3 minőségét érzelemvezérléssel, alacsony késleltetéssel és egyszerű integrálhatósággal. A nyílt súlyok és a rövid hangmintából működő klónozás különösen vonzóvá tehetik a megoldást azok számára, akik saját szerveren szeretnének beszédmodelleket futtatni.


body_en:

Voxtral TTS: 4B model with emotion steering and open weights

A new entrant in the speech-synthesis space, Voxtral TTS is a 4-billion-parameter (4B) model designed for production use and optimized for natural-sounding speech.

Human preference tests and quality comparison

In side-by-side human evaluations against ElevenLabs Flash v2.5, Voxtral TTS was preferred for naturalness: it won 58.3% of flagship voice preference tests. For voice customization, Voxtral achieved a 68.4% win rate compared with Flash v2.5.

The developers state that Voxtral matches the quality of ElevenLabs v3 while adding emotion-aware control, allowing output to be shaped by contextual cues (for example neutral, happy, sarcastic, and other tones) so that the speech sounds more considered and less robotic.

Performance and integration

The model is reported to have about 70 ms model latency and an approximate ~9.7× real-time factor. It supports native streaming and can be integrated into existing speech-to-text (STT) and large language model (LLM) stacks.

Voice cloning and adaptation

Voxtral can clone a voice from three seconds of audio, adapting tone, personality, rhythm, and intonation. The cloning is described as zero-shot and requires no fine-tuning.

Licensing and deployment

The model weights are released under the CC BY-NC 4.0 license, allowing deployment on private infrastructure and extension to custom voice libraries, subject to the license’s non-commercial terms.

Summary

Positioned as a lightweight production-ready TTS, Voxtral claims more natural output than ElevenLabs Flash v2.5, v3-level quality with emotion steering, low latency, and easy integration. The open weights and short-sample voice cloning may appeal to users who want to run and extend speech models on their own infrastructure.