Il nuovo standard di produzione per il text-to-speech
Il 20 luglio 2026 Tongyi Lab di Alibaba ha rilasciato Qwen-Audio-3.0-TTS, un sistema di sintesi vocale orientato alla produzione e disponibile esclusivamente come modello hosted su Alibaba Cloud Model Studio.
Il modello arriva in due varianti dello stesso lineage:
- Flash: ottimizzato per interazioni real-time, con latenza del primo pacchetto intorno ai 300 ms.
- Plus: orientato alla massima qualità, naturalezza e fidelità di timbro.
Entrambe le versioni condividono la stessa libreria di voci e gli stessi meccanismi di controllo.
Perché è SOTA
Il tier Plus ha raggiunto il primo posto sull'Artificial Analysis Speech Arena (Elo circa 1234), superando Simba 3.2, Gemini 3.1 Flash TTS e Sonic 3.5. Il posizionamento è basato su voti ciechi di utenti reali.
Oltre al ranking, i numeri tecnici sono solidi:
- Migliore intelligibilità multilingue (WER/CER più basso in 10 delle 16 lingue)
- Speaker similarity più alta su tutte le 16 lingue (media 82.75 per Plus)
- Output fino a 48 kHz e sintesi continua one-pass fino a 3 minuti
Controlli e robustezza
Due modalità di guida:
- Istruzioni in linguaggio naturale ("leggi lentamente come una storia della buonanotte", "tono arrabbiato e ritmo incalzante").
- 86 tag inline precisi: [angry], [laughs], [gasp], [whispers], [sighing] e molti altri per respiri, emozioni e effetti non verbali.
Il voice cloning è particolarmente robusto: riesce a preservare il timbro anche da riferimenti rumorosi o fortemente riverberanti, grazie a un enhancement acustico integrato.
Copertura linguistica
16 lingue ufficiali: arabo, cinese (con 20 regioni dialettali migliorate), inglese, francese, tedesco, indonesiano, italiano, giapponese, coreano, malese, portoghese, russo, spagnolo, tagalog, thai e vietnamita.
Disponibilità
Il modello è accessibile solo via API su Alibaba Cloud Model Studio (DashScope / WebSocket). Non sono stati rilasciati pesi open-source. I model ID ufficiali sono qwen-audio-3.0-tts-flash e qwen-audio-3.0-tts-plus.
Per chi lavora su agent vocali, doppiaggio, audiolibri o contenuti multilingue, Qwen-Audio-3.0-TTS rappresenta uno dei passi avanti più concreti del 2026 nel settore TTS hosted.
Testo: assistito da AI · revisionato da Carlos H. P. Ross




