Inflect Micro v2 è un modello di sintesi vocale text-to-waveform completo da 9.356.513 parametri che trasforma testo inglese in audio mono a 24 kHz senza vocoder esterno, senza API remote e senza secondi modelli appresi. Il checkpoint FP32 pesa 37,53 MB e gira interamente in locale su CPU o CUDA.
Il sistema appartiene alla famiglia VITS: frontend fonemico inglese, encoder transformer, predizione della durata, generazione latente stocastica, residual coupling flow e decoder neurale con riduzione alias. Tutto è incluso nel conteggio dei parametri di inferenza. Non si tratta di un modello acustico isolato: dal testo grezzo si ottiene direttamente la waveform.
Metriche e confronti
Nei test ufficiali Inflect Micro v2 registra:
- UTMOS22 4.395 (intervallo di confidenza 95%: 4.381–4.408)
- WER semantico medio 3,99% (media di Qwen3-ASR e Nemotron 3.5)
- Preferenza community 66,2% in ascolti ciechi a coppie (21 vittorie, 10 sconfitte, 3 pari)
- Throughput 6,28× real-time su CPU a 4 thread (RTF 0,1593)
Nella classifica di preferenza umana risulta secondo, dietro solo a una variante di KittenTTS Nano e davanti a Piper Low e Supertonic 3. Il modello Nano-v2 (3,96M parametri) ottiene valori molto vicini: UTMOS22 4.386 e preferenza 63,9%, con velocità ancora superiore (10,72×).
Caratteristiche operative
L'API Python unificata espone controlli di speed (0,5–2,0), variation (0,0–1,0) e seed intero per output deterministici. I testi lunghi vengono spezzati in modo consapevole della punteggiatura, con pause controllate e fade ai bordi. Sono disponibili sia il runtime PyTorch sia l'export ONNX ufficiale (duration.onnx + decode.onnx) con provider CPU, CUDA e DirectML.
Il progetto include un toolkit pubblico di adattamento per fine-tuning di nuove voci o lingue, purché si disponga di dati di proprietà o con licenza e di un frontend fonemico compatibile. La qualità adattata resta sperimentale e dipende dal dataset e dalla valutazione con parlanti madrelingua.
Limiti dichiarati
Il modello è inglese-only e usa una sola voce maschile sintetica fissa. Non supporta zero-shot voice cloning né riferimento audio a runtime. Nomi non familiari, abbreviazioni, numeri e omografi restano i casi più difficili. Possono comparire occasionali artefatti metallici o clipping, soprattutto su input estremi.
Disponibilità
I pesi, il codice di inferenza, il frontend, gli artefatti di valutazione e i report sono pubblici sotto licenza Apache-2.0. Il modo più rapido per provarlo è il playground interattivo su Hugging Face. Esistono anche repository ONNX dedicati e un repository GitHub con documentazione di deployment, architettura e protocolli di valutazione.
Inflect Micro v2 dimostra che è possibile ottenere qualità di sintesi utilizzabile in un footprint estremamente ridotto. Per sviluppatori di agent locali, applicazioni edge e prototipi voice-first senza accesso a GPU dedicate, rappresenta un punto di riferimento concreto sul rapporto dimensioni-qualità.
Testo: assistito da AI · revisionato da Carlos H. P. Ross




