Microsoft Research ha rilasciato VibeVoice-ASR-BitNet, una variante quantizzata e altamente ottimizzata del modello VibeVoice-ASR. Progettata specificamente per l'inferenza in tempo reale su CPU edge, questa versione elimina il bisogno di GPU e porta le prestazioni di un sistema ASR basato su language model a dispositivi commodity.
Il modello parte da un footprint FP16 di 4.62 GB e arriva a soli 1.58 GB grazie a una strategia di quantizzazione eterogenea. Il tokenizer acustico VAE viene quantizzato in full-pipeline INT8 (I8_S) con fusioni di kernel e ottimizzazioni SIMD, mentre il decoder language model adotta pesi ternari in stile BitNet (I2_S) a 2 bit, con embedding e head in Q6_K. Il risultato è una compressione complessiva di 2.9× e un'efficienza di memoria e banda che permette velocità notevolmente superiori rispetto a soluzioni INT8 tradizionali.
Nei test ufficiali su hardware AMD EPYC 7V13 (AVX2+FMA) con clip audio di 20 secondi, VibeVoice-ASR-BitNet risulta 1.6–2.3× più veloce di Whisper.cpp large-v3-turbo quantizzato INT8 a dimensione paragonabile (~1.6 GB). Il Real-Time Factor scende sotto 1 già con 3 thread (RTF 0.77) e continua a migliorare fino a 0.42 con 8 thread. Prestazioni simili sono state misurate anche su Apple M4 (NEON) e Intel Core i7-13700.
Sul fronte dell'accuratezza, il degrado rispetto al baseline FP16 del modello 7B è contenuto: tipicamente tra 1 e 4 punti percentuali assoluti di WER. Su MLC-EN il modello ottiene 8.25% (contro 13.57% di Whisper), su AMI-ihm 21.36%, su AMI-sdm 25.87% e su VoxPopuli 5.18%. Resta competitivo anche su Fleurs e LibriSpeech, pur non raggiungendo i picchi dei modelli specializzati in sola lingua inglese o cinese.
VibeVoice-ASR-BitNet supporta nativamente inglese, cinese, francese, italiano, coreano, portoghese e vietnamita. L'architettura ereditata da VibeVoice-ASR (tokenizer VAE a 7.5 Hz + decoder autoregressivo) consente di gestire audio conversazionali e long-form senza le limitazioni tipiche dei sistemi encoder-only tradizionali.
Il runtime ufficiale è VibeASR.cpp, un'implementazione basata su ggml con kernel SIMD custom per x86 e ARM. I file GGUF pronti all'uso (vae-encoder-i8_s e lm-i2_s-embed-q6_k) sono disponibili su Hugging Face insieme a un demo Space interattivo. Il technical report completo è pubblicato su arXiv (2607.21075).
Per sviluppatori che lavorano su laptop, server edge, dispositivi embedded o qualsiasi ambiente senza GPU dedicata, VibeVoice-ASR-BitNet rappresenta una delle opzioni open-source più concrete oggi disponibili. Combina velocità reale, footprint contenuto e qualità multilingue in un unico pacchetto MIT.
Quantizzazione eterogenea e ottimizzazioni runtime
La chiave delle prestazioni risiede nella scelta di applicare quantizzazioni diverse ai due stadi del modello. Il VAE, fortemente bound dalle attivazioni, beneficia della pipeline INT8 completa che elimina conversioni di precisione e riduce il traffico di memoria di 2×. Il decoder LM, invece, è weight-bound: i pesi ternari riducono l'occupazione di 8× rispetto a FP16 e permettono speedup fino a 4× nella fase di decode.
Kernel fused (im2col_asym, mul_mat_add_relu) e implementazioni SIMD a blocchi di 32/64/128 elementi massimizzano l'utilizzo delle unità AVX2 e NEON. Il training ha utilizzato progressive quantization-aware training per limitare la perdita di accuratezza.
Confronto diretto con Whisper.cpp
A parità di dimensione (~1.6 GB) e hardware, VibeVoice-ASR-BitNet mostra un vantaggio chiaro soprattutto a basso numero di thread, dove la pressione sulla banda di memoria è maggiore. Whisper.cpp rimane un riferimento solidissimo, ma l'approccio eterogeneo I8_S + I2_S dimostra che è possibile spingere ulteriormente compressione e velocità senza sacrificare troppo la qualità multilingue.
Disponibilità e utilizzo pratico
I pesi GGUF e il codice sono pubblicati sotto licenza MIT. L'installazione richiede solo CMake, un compilatore C++11 e circa 2 GB di spazio. È disponibile anche una demo Gradio ufficiale. Non è ancora supportato lo streaming, ma l'inferenza offline batch su clip fino a diversi minuti è già pienamente funzionale.
VibeVoice-ASR-BitNet non è solo un altro modello quantizzato: è una dimostrazione concreta che l'ASR basato su language model può diventare un cittadino di prima classe anche sui dispositivi più limitati.
Testo: assistito da AI · revisionato da Carlos H. P. Ross




