text-to-speech (tts)
Text-to-speech (TTS) converts written text into natural-sounding spoken audio with appropriate prosody and expression. **Modern architecture**: Text analysis leads to acoustic features leads to neural vocoder leads to audio waveform. End-to-end models (VITS, YourTTS) combine stages. **Key models**: Tacotron 2 (attention-based), FastSpeech 2 (parallel, fast), VITS (end-to-end, high quality), XTTS (multilingual + voice cloning). **Prosody modeling**: Pitch, duration, stress, emotion. Modern models learn prosody from data, controllable prosody variants exist. **Voice quality factors**: Naturalness, intelligibility, expressiveness, similarity (for cloning). **Commercial services**: ElevenLabs (leading quality), Amazon Polly, Google Cloud TTS, Azure, Play.ht. **Open source**: Coqui TTS, Piper, Bark (expressive, can laugh/sing), StyleTTS 2. **Voice cloning**: Learn new voices from few seconds to minutes of audio. **Multilingual**: Cross-lingual models support 100+ languages. **Applications**: Audiobooks, accessibility, virtual assistants, video narration, podcasts, gaming NPCs. **Evaluation**: MOS (Mean Opinion Score). Approaching human-level quality for many voices.