Home Knowledge Base Modern architecture

Text-to-speech (TTS) converts written text into natural-sounding spoken audio with appropriate prosody and expression. Modern architecture: Text analysis leads to acoustic features leads to neural vocoder leads to audio waveform. End-to-end models (VITS, YourTTS) combine stages. Key models: Tacotron 2 (attention-based), FastSpeech 2 (parallel, fast), VITS (end-to-end, high quality), XTTS (multilingual + voice cloning). Prosody modeling: Pitch, duration, stress, emotion. Modern models learn prosody from data, controllable prosody variants exist. Voice quality factors: Naturalness, intelligibility, expressiveness, similarity (for cloning). Commercial services: ElevenLabs (leading quality), Amazon Polly, Google Cloud TTS, Azure, Play.ht. Open source: Coqui TTS, Piper, Bark (expressive, can laugh/sing), StyleTTS 2. Voice cloning: Learn new voices from few seconds to minutes of audio. Multilingual: Cross-lingual models support 100+ languages. Applications: Audiobooks, accessibility, virtual assistants, video narration, podcasts, gaming NPCs. Evaluation: MOS (Mean Opinion Score). Approaching human-level quality for many voices.

text-to-speech (tts)text-to-speechttsaudio

Related Topics

Explore 500+ Semiconductor & AI Topics

From EUV lithography to CUDA optimization — search the full knowledge base or chat with our AI assistant.